Una tarde de marzo de 2016 en Seúl, vi cómo un programa que había ayudado a desarrollar colocaba una piedra en la quinta línea de un tablero de go en lo que parecía un regalo para su rival humano. El movimiento 37 de la segunda partida de aquel encuentro a cinco juegos pareció tan absurdo que algunos comentaristas creyeron que se trataba de un error de programación. No lo era. AlphaGo ganó la partida y acabó imponiéndose por 4-1 a Lee Sedol, uno de los mejores jugadores profesionales de go de todos los tiempos. «Pensaba que AlphaGo se basaba en el cálculo de probabilidades y que no era más que una máquina», declaró Lee después. «Pero cuando vi esta jugada, cambié de opinión. Sin duda, AlphaGo es creativo».
Cuando Deep Blue derrotó en 1997 al entonces vigente campeón mundial de ajedrez Garry Kasparov, lo hizo anticipando entre seis y ocho movimientos por jugador y evaluando 200 millones de posiciones por segundo, a partir de reglas codificadas directamente por humanos. El go es un juego infinitamente más complejo. El valor de una piedra depende de cómo evolucionen grupos distantes y el territorio a lo largo de decenas de movimientos. Calcular siquiera una fracción de los posibles resultados le llevaría a un superordenador miles de millones de años. Para ganar, AlphaGo tenía que intuir de un vistazo quién llevaba ventaja e incluso inventar jugadas que a ningún humano se le habían ocurrido jamás.
Por eso muchas crónicas del enfrentamiento de AlphaGo contra Lee retratan la jugada 37 como un destello de pura intuición de la máquina. Pero se trata de un malentendido. En realidad, fue la capacidad de razonamiento de AlphaGo la que tomó esta decisión creativa —unas facultades de las que carece la IA actual—. Si queremos que los futuros sistemas de IA ofrezcan resultados fiables y hallazgos verdaderamente novedosos en campos como la ciencia y la medicina, debemos dotarlos de auténticas capacidades de razonamiento de este tipo.
AlphaGo está compuesto por dos sistemas. El primero, su red de políticas, fue entrenada para predecir qué movimiento haría un jugador humano de alto nivel. Esta parte «intuitiva» consideró que el movimiento 37 no tenía nada de especial—una jugada que tenía una probabilidad aproximada de una entre 10.000 de ser realizada por un jugador humano experto. Lo que hizo que AlphaGo lo eligiera fue el mecanismo de búsqueda del programa, que miró más allá de la plausibilidad inmediata y sopesó las consecuencias futuras de los movimientos propuestos. Construyó y exploró de forma explícita un árbol de juego con miles de ramas, cada una de las cuales representaba un futuro posible diferente.
Una conocida teoría de las ciencias del comportamiento, popularizada por Daniel Kahneman, distingue entre dos modos de pensamiento humano: el Sistema 1 es rápido, intuitivo y no requiere esfuerzo; el Sistema 2 es lento, paso a paso y deliberativo. AlphaGo ofreció un sorprendente análogo computacional de esa división. Sus redes aportaban las corazonadas —esta jugada parece prometedora, esta posición parece ganadora— y su búsqueda aportaba la deliberación, contrastando esas corazonadas con las jugadas y réplicas posteriores. Al igual que en la cognición humana, ninguna de las dos partes funciona por sí sola. La intuición por sí misma jamás habría optado por la jugada 37, y una búsqueda por fuerza bruta se habría visto en serias dificultades para cribar la enorme cantidad de movimientos posibles.
Esto contrasta de forma radical con el funcionamiento de los modelos de IA actuales. Un modelo de lenguaje de gran tamaño se limita a seleccionar el siguiente token, una y otra vez. Eso equivale al Sistema 1 en acción: rápido, asociativo y con una capacidad sorprendente para completar patrones en prácticamente cualquier tema sobre el que se escriba.
Poco después del debut de ChatGPT, el sector se percató de que la fluidez lingüística por sí sola se queda corta frente a una utilidad real. La solución aparente fue crear modelos que deliberen: en lugar de responder de inmediato, ahora pueden generar pasos intermedios que descomponen un problema, trasladan resultados parciales e influyen en el razonamiento posterior, un proceso conocido como «cadena de pensamiento». Los avances han demostrado ser reales, sobre todo en matemáticas y programación. Pero, a diferencia de la búsqueda de AlphaGo, esto no introduce un mecanismo de razonamiento genuinamente independiente: el razonamiento intermedio sigue generándose mediante el mismo proceso de predicción del siguiente token, iterado durante más tiempo antes de que el modelo se decante por una respuesta.
Tres deficiencias impiden que lo que hacen los chatbots se califique de razonamiento (en un sentido que un científico reconocería). En primer lugar, estos modelos no suelen mantener un estado epistémico explícito, persistente e inspeccionable. No existe un registro abierto que detalle las hipótesis que el modelo está considerando, la confianza que tiene en las distintas explicaciones, las pruebas que sopesa y las preguntas sin resolver a las que se aferra —aspectos todos ellos que deberían revisarse de forma sistemática a medida que llega nueva información—. En segundo lugar, carecen de una separación nítida entre lo que el sistema sabe y cómo manipula ese conocimiento. El conocimiento y el razonamiento están inextricablemente entrelazados en los pesos de la red neuronal —no existe un conjunto de creencias independiente y representado de forma explícita—. En tercer lugar, aunque las cadenas de pensamiento que producen los chatbots se asemejan a una deliberación, las investigaciones han demostrado que los bots a menudo inventan estas cadenas a posteriori, alcanzando una respuesta por una vía pero comunicando otra.
Esto es un problema porque, en las aplicaciones críticas que a todos nos importan, como la medicina, la ingeniería y la investigación científica, no solo cuenta a qué conclusión llega un sistema, sino también cómo llega a ella. Cuando se producen errores —por ejemplo, en el diagnóstico y tratamiento médicos—, necesitamos poder determinar con exactitud qué ha fallado: ¿falló el razonamiento del sistema, se basó en pruebas no válidas o partió de premisas incorrectas?
Por eso dejé recientemente mi puesto en Google DeepMind. Creo que necesitamos un nuevo enfoque para el razonamiento automático—uno que se base en la arquitectura de AlphaGo. AlphaGo mantiene un registro de lo que sabe sobre una posición determinada: el árbol de juego. Esta estructura de datos contiene todas las variantes, los posibles futuros, que AlphaGo ha considerado, con cada movimiento y posición anotados con las valoraciones emitidas por sus redes neuronales. A medida que avanza su razonamiento, AlphaGo actualiza el árbol de juego y, finalmente, sintetiza la información contenida en él para decidir qué movimiento realizar.
De forma similar, para el razonamiento general un sistema debería mantener un estado epistémico que represente lo que el sistema considera establecido, lo que pone en duda, lo que ha descartado y qué preguntas permanecen abiertas. El razonamiento puede entenderse entonces como una secuencia de movimientos que modifican el estado epistémico para ampliar el conocimiento y reducir la incertidumbre: deducir consecuencias, descomponer los problemas en partes y—lo que es crucial—decidir qué pregunta plantear, qué cálculo realizar o qué experimento llevar a cabo a continuación.
Por supuesto, el razonamiento en un mundo abierto es más difícil que jugar a un juego de mesa como el Go o el ajedrez. En el mundo real, el estado actual de las cosas solo se conoce parcialmente, el conjunto de acciones disponibles es amplio y variable, y las consecuencias de las acciones son estocásticas o desconocidas.
Sin embargo, los recientes avances en los LLM y otros modelos neuronales nos brindan ahora la capacidad de abordar tales problemas de razonamiento general. Por ejemplo, los LLM pueden sugerir formas de afrontar un problema a partir de lo que se sabe y de los recursos disponibles. Pueden interactuar con herramientas a través de API o código y ayudar a evaluar si una afirmación está respaldada por las pruebas disponibles.
Lo más importante: para mantener la honestidad del sistema, una parte independiente de este debe evaluar cada movimiento en función de hasta qué punto disipa realmente la incertidumbre, actualizando las creencias solo cuando el cambio esté respaldado por evidencias. Una vez aplicadas estas reglas, el modelo puede acumular conocimiento verificado y mejorar su política de razonamiento aprendiendo de experiencias de razonamiento previas. Puedes concebir un sistema así como el método científico con esteroides, con el propósito de generar un conocimiento capaz de resistir cualquier escrutinio.
No creo que alcancemos una inteligencia maquinal fiable haciendo más grande el sistema 1. La escala agudiza la intuición, pero no la hace más deliberativa. El movimiento 37 fue crucial porque una máquina mantuvo una posición, sopesó los posibles futuros y eligió la jugada que sus instintos artificiales probablemente habrían descartado. La sociedad necesita movimientos creativos como ese en el descubrimiento de fármacos, los nuevos materiales, el clima o el diagnóstico médico: campos en los que el tablero no se parece en nada al del go y nadie nos entrega las reglas. Solo obtendremos tales hallazgos a partir de sistemas que razonen; sistemas cuyas conclusiones surjan de una secuencia auditable de evidencias, inferencias y revisión de creencias, y no de un relato convincente contado a posteriori.
Thore Graepel es catedrático de Aprendizaje Automático en el University College London. Fue un miembro clave del equipo de AlphaGo en DeepMind y trabaja para garantizar que la IA beneficie al florecimiento humano.

