El simulador Vista del #MIT demuestra que el aprendizaje por refuerzo funciona en carreteras reales
La formación en vehículos autónomos tiene grandes puntos ciegos. La industria ha dependido de los datos recopilados de conductores humanos durante años. Ideal para la vida cotidiana, como los desplazamientos y los atascos. Pero cuando las cosas van mal, fracasa catastróficamente. No se le puede pedir a un humano que conduzca en un accidente sólo para enseñarle a la máquina. No estamos pidiendo a las personas que arriesguen sus vidas para obtener puntos de datos. Esto deja un vacío. El caso límite definitivo. Este es el momento en el que los reflejos se vuelven más importantes que la vida diaria.
La simulación llena este vacío. Crea una situación infinitamente variable y peligrosa que nunca sucedería en la realidad. Sólo hay un problema. Hasta ahora, los sistemas entrenados enteramente en simuladores no han logrado conducir autos reales en carreteras reales. Este es un puente de tráfico teórico.
La situación ha cambiado recientemente. Un equipo de investigadores del Instituto Tecnológico de Massachusetts (MIT) ha construido un simulador realista llamado Vista (Síntesis y transformación de imágenes virtuales para la autonomía ). Lo condujeron.
Cómo Vista crea una realidad infinita
Vista hace más que simplemente dibujar gráficos. Reconstruir la física. El grupo comenzó con imágenes del mundo real. Esta es el ancla. Pero la magia ocurre durante el procesamiento.
El motor de renderizado representa cada píxel como una nube de puntos 3D. Profundidad del mapa. Distancia del mapa. Mapea el movimiento. Luego coloque su vehículo virtual en este espacio digital.
Aquí es donde las redes neuronales toman el control. Escena de procesamiento de redes neuronales convolucionales. Calcula la profundidad de campo. Predice cómo se moverá cada objeto en relación con el automóvil. El sistema sintetiza nuevas rutas de vuelo basadas en esta información. No se trata sólo de reproducir vídeos. Crea un nuevo camino en el espacio 3D.
El controlador no está conectado al coche real. Nunca ha visto el camino. No tiene ningún conocimiento sobre cómo conducen los humanos.
Este proceso se repite. El sistema crea escenas realistas basadas en rutas de vuelo calculadas. No es un activo pregrabado. Generado inmediatamente. Esto permite infinitas variaciones. Puedes cambiar el clima. Puedes cambiar la iluminación. Puedes cambiar el comportamiento de otros agentes virtuales. Todo de las grabaciones originales.
Educación para ciegos
El objetivo de los controladores de IA es simple. Manténgase en el carril. No te estrelles.
eso es todo.
Al principio, la IA no sabe nada de conducción. No sabe lo que hace una rueda. No sabe lo que significa un semáforo. Trabajar dentro de limitaciones básicas. Si chocas, recibirás una señal de penalización. Este es el aprendizaje por refuerzo en acción.
El sistema aprende mediante prueba y error. Después de cada falla, el emulador cambia el entorno. Se introduce una nueva variable. Obligar a la IA a adaptarse. No se proporciona un libro de reglas. Da retroalimentación.
El modelo se completa tras 10.000 kilómetros de conducción simulada. El equipo instaló a un conductor capacitado en un automóvil autónomo real.
De los píxeles al pavimento
Las pruebas no son una pista controlada. Este es el camino correcto. Los coches circulan en entornos sin precedentes. La IA no conoce de antemano determinadas calles. No hay patrones geométricos. Se basa enteramente en habilidades aprendidas en el vacío.
Funcionó.
Este es un evento innovador. Esta es la primera vez que la IA entrenada mediante aprendizaje por refuerzo en un entorno 100% virtual se implementa en un vehículo físico. El controlador estuvo ciego al mundo real hasta el momento crítico.
El equipo del MIT ha creado más que una simple herramienta. Presentaron un método. La brecha entre la simulación y la realidad se está cerrando. No se trata de agregar datos humanos. Pero dejando que la máquina aprenda en el entorno limitado digital.
¿Qué pasa después?
El siguiente paso es obvio. Las simulaciones actuales requieren la consideración de varias variables. Cielo. noche. sol. lluvia. nieve. Al equipo le gustaría generar estas condiciones a partir de un único archivo de trayectoria. No se requieren nuevas imágenes.
También hay planes para introducir interacciones complejas. Otros vehículos no son sólo obstáculos estáticos. Su comportamiento se vuelve impredecible. Ellos reaccionarán.
Esta investigación fue publicada en IEEE Robotics and Automation Letters. El equipo del MIT planea abrir Vista de código abierto pronto.
Esto es importante para los aficionados que comprenden la diferencia entre capas convolucionales y modelos de transformadores. Está más allá de la fase de “qué pasaría si”. Estamos viendo la primera evidencia concreta de que el entrenamiento sintético puede sobrevivir a una realidad caótica.
Este coche pasa la prueba. Se adaptó.
¿Otros fabricantes seguirán su ejemplo? El código está por llegar. La metodología está probada. La era del entrenamiento puramente sintético ya no es una hipótesis. Está en el camino.























