La firma de robótica e inteligencia artificial Generalist AI ha dado un paso adelante en la interacción física con el lanzamiento de su modelo GEN-1.5. Esta tecnología permite que un robot aprenda a realizar una tarea nueva simplemente observando una demostración humana o simulada de entre 3 y 12 segundos, eliminando la necesidad de realizar ajustes finos o programaciones complejas para cada acción.

Aprendizaje basado en movimiento
El concepto, denominado physical prompting, funciona de manera similar a como interactuamos con los modelos de lenguaje (LLM). En lugar de escribir instrucciones, el usuario proporciona un vídeo con los movimientos necesarios. El robot analiza el estado inicial y la manipulación del objeto, interpretando el objetivo final en lugar de limitarse a copiar una trayectoria fija. Esta capacidad le permite ejecutar acciones como abrir recipientes, mover objetos o manipular cierres tras una breve observación.
Resultados actuales y desafíos
Aunque el sistema es innovador, todavía se encuentra en una fase temprana de desarrollo. Durante las pruebas iniciales con diez tareas de manipulación, el modelo alcanzó una tasa de éxito del 59%. Los desarrolladores reconocen que las funciones adquiridas mediante este contexto visual son menos estables que las obtenidas por entrenamiento tradicional.
Sin embargo, la eficiencia mejora notablemente con un entrenamiento adicional mínimo. Al proporcionar unos cinco minutos de datos adicionales —equivalentes a 50 demostraciones—, la tasa de éxito asciende al 83%. Este proceso requiere cambios menores en los pesos del modelo, aprovechando la base de más de medio millón de horas de interacción física con la que ha sido preentrenado GEN-1.5.



!Advertencia! Tenemos problemas...
Debes iniciar sesión para poder comentar.. Iniciar sesión o Registrarme