Innovadores Menores de 35 2026 · Computación y robótica · Instituto de Innovación de Shanghái · 33 años
¿Cómo se le enseña una nueva habilidad a un robot? Una forma es el aprendizaje por refuerzo: los robots son entrenados en simulaciones o con vídeos de la tarea siendo realizada, y luego la practican muchas veces por sí mismos. Cuando lo hacen bien, obtienen recompensas virtuales.
Jianlan Luo, de 33 años, ha ampliado las técnicas estándar utilizadas en el aprendizaje por refuerzo para idear formas nuevas y mejores de enseñar a los robots muchas tareas diferentes con mayor rapidez. También creó un sistema que permite a los robots aprender unos de otros compartiendo datos de rendimiento.
Luo mostró aptitud para las matemáticas desde joven y le encantaba trabajar con motores, sensores y código. Estudió ingeniería en la Universidad Tecnológica de Wuhan en China y programó coches de carreras modelo autónomos en su tiempo libre. Luego, mientras estaba en la UC Berkeley para su doctorado, conoció y comenzó a colaborar con un grupo de investigadores que estaba utilizando el aprendizaje por refuerzo para entrenar robots.
Pronto comenzó a experimentar con nuevos enfoques propios. En un artículo publicado el año pasado, demostró que incorporar la retroalimentación humana durante el proceso de entrenamiento acelera drásticamente la capacidad de un robot para dominar una serie de nuevas tareas (como voltear un huevo en una sartén o montar una estantería de IKEA). Esta técnica también duplicó la tasa de éxito de los robots en comparación con los robots entrenados utilizando métodos convencionales.
Luo regresó a China en 2025 para probar sus métodos en una línea de producción piloto con un fabricante de electrónica y comenzó a asesorar a AgiBot, uno de los principales productores mundiales de robots humanoides. Con ese equipo, creó un marco para asegurar que los robots sigan mejorando incluso después de comenzar a trabajar en el mundo real. Cada robot carga sus propios datos de rendimiento a una base de datos central, que los combina con las lecciones de otros robots de su flota antes de enviar los aprendizajes colectivos de vuelta a todo el grupo. En otro proyecto relacionado, Luo logró escalar este estilo de aprendizaje a través de 16 robots. Espera probarlo pronto en una flota de 100 robots.
De cara al futuro, su gran ambición es crear un ecosistema de código abierto de herramientas de entrenamiento y modelos fundacionales para ayudar a que las capacidades de los robots mejoren más rápidamente. Con ese fin, recientemente lanzó un modelo del mundo de código abierto para permitir a los robots predecir mejor las consecuencias de sus acciones. Aunque todavía queda mucho por hacer, Luo está ayudando al campo a progresar a un ritmo más rápido, al igual que los robots que entrena.

