— A fondo
Un agente que se mejora solo sin reentrenar el modelo, de la UCL y Huawei
Investigadores del University College de Londres y del laboratorio Noah's Ark de Huawei presentan Memento 3, un agente que va escribiendo y corrigiendo un «libro de reglas» sobre cómo funciona el entorno, lo convierte en código para simular y así aprende sin tocar el modelo que lleva dentro. En el exigente banco ARC-AGI-3 resuelve el 100% de los niveles de los 25 juegos públicos usando solo el 44% de las acciones de una persona, y en el Pong gana 21 a 0 sin gastar ni una sola llamada al modelo. El truco es la verificación: los cambios solo se aceptan si reproducen paso a paso lo observado, y varios agentes comparan versiones distintas para explorar mejor.
