Innovadores menores de 35 2026 · Computación y robótica · Google DeepMind · Edad 32
Incluso los robots más avanzados carecen de cierta destreza. Funcionando más como cocineros de línea de una sola estación que como ágiles sous chefs, sobresalen en la ejecución de una tarea específica y familiar mil veces. Pero si se les coloca en una cocina nueva, se cambia el menaje o se alteran los ingredientes, todo el plato puede venirse abajo. Shuang Li, investigadora científica en Google DeepMind, trabaja para dotar a los robots de un tipo de inteligencia más flexible.
Durante su doctorado en el MIT, Li, de 32 años, fue una de las primeras en contribuir a la investigación que demostraba que los modelos de lenguaje podían guiar la toma de decisiones de un robot: dado un ento o fijo, un agente de IA podía describir el curso de acción correcto para lograr un objetivo particular.
Sin embargo, elaborar un plan es solo una parte del rompecabezas. Aunque conozca los pasos correctos, un robot al que se le ha pedido que meta una manzana en la nevera aún necesita identificar tanto la manzana como la nevera, y realizar una serie de acciones en un ento o que posiblemente sea bastante diferente de los ejemplos visuales de los que aprendió.
Durante su postdoctorado en Stanford, Li lideró el desarrollo de Unified Video Action, o UVA, un modelo de entrenamiento que ayuda a los robots a transferir lo que aprenden entre ento os. Los vídeos de entrenamiento enseñan al robot no solo qué acción tomar, sino también cómo esa acción específica cambiará lo que el robot ve. Si está recogiendo una taza, por ejemplo, el robot aprende a concentrarse en la taza –siguiéndola a medida que se mueve hacia arriba– en lugar de, por ejemplo, centrarse en objetos de fondo o incluso en su propia mano. Este enfoque ayuda a evitar que el robot se confunda con un ento o desconocido.
Lanzado en 2025 como un paquete de código abierto, UVA ahora guía el trabajo de Li en Google DeepMind, donde intenta combinar las habilidades de planificación de los modelos de lenguaje y la intuición física de los modelos de vídeo en un único sistema. Li espera que, a medida que los robots se diseñen para tareas más complejas y los costes de entrenamiento disminuyan, modelos como UVA ayuden a los robots a convertirse en mejores asistentes, ya sea en la cocina o en cualquier otro lugar.

