Le simulateur Vista du #MIT prouve que l’apprentissage par renforcement fonctionne sur de vraies routes
La formation en voiture autonome présente de grands angles morts. L’industrie s’appuie depuis des années sur les données collectées auprès des conducteurs humains. Idéal pour la vie quotidienne, comme les déplacements domicile-travail et les embouteillages. Mais quand les choses tournent mal, cela échoue catastrophiquement. Vous ne pouvez pas demander à un humain de traverser un quasi-accident juste pour apprendre à la machine. Nous ne demandons pas aux gens de risquer leur vie pour obtenir des données. Cela laisse un vide. Le cas ultime. C’est le moment où les réflexes deviennent plus importants que la vie quotidienne.
La simulation comble cette lacune. Cela crée une situation infiniment variable et dangereuse qui ne se produirait jamais dans la réalité. Il y a juste un problème. Jusqu’à présent, les systèmes entièrement entraînés sur simulateurs n’ont pas réussi à conduire de vraies voitures sur de vraies routes. Il s’agit d’un pont de circulation théorique.
La situation a changé récemment. Une équipe de chercheurs du Massachusetts Institute of Technology (MIT) a construit un simulateur réaliste appelé Vista (Virtual Image Synthesis and Transformation for Autonomy ). Ils l’ont conduit.
Comment Vista crée une réalité infinie
Vista fait bien plus que simplement dessiner des graphiques. Reconstruisez la physique. Le groupe a commencé avec des images du monde réel. C’est l’ancre. Mais la magie opère lors du traitement.
Le moteur de rendu restitue chaque pixel sous forme de nuage de points 3D. Profondeur de la carte. Distance de la carte. Il cartographie le mouvement. Déposez ensuite votre véhicule virtuel dans cet espace numérique.
C’est là que les réseaux de neurones prennent le relais. Scène de traitement des réseaux de neurones convolutifs. Calculez la profondeur de champ. Prédisez comment chaque objet se déplacera par rapport à la voiture. Le système synthétise de nouvelles trajectoires de vol sur la base de ces informations. Il ne s’agit pas seulement de lire des vidéos. Créez un nouveau chemin dans l’espace 3D.
Le contrôleur n’est pas attaché à la voiture réelle. Il n’a jamais vu la route. Il n’a aucune connaissance de la façon dont les humains conduisent.
Ce processus se répète. Le système crée des scènes réalistes basées sur des trajectoires de vol calculées. Il ne s’agit pas d’un actif préenregistré. Généré immédiatement. Cela permet des variations infinies. Vous pouvez changer la météo. Vous pouvez changer l’éclairage. Vous pouvez modifier le comportement d’autres agents virtuels. Le tout à partir des enregistrements originaux.
Éducation des aveugles
L’objectif des pilotes IA est simple. Restez dans la voie. Ne vous écrasez pas.
c’est ça.
Au début, l’IA ne connaît rien à la conduite. Il ne sait pas ce que fait une roue. Il ne sait pas ce que signifie un feu de circulation. Travaillez dans le cadre de contraintes de base. Si vous tombez, vous recevez un signal de pénalité. C’est l’apprentissage par renforcement en action.
Le système apprend par essais et erreurs. Après chaque échec, l’émulateur modifie l’environnement. Une nouvelle variable est introduite. Forcez l’IA à s’adapter. Un livret de règles n’est pas fourni. Cela donne des commentaires.
Le modèle est terminé après 10 000 kilomètres de conduite simulée. L’équipe a installé un chauffeur qualifié dans une véritable voiture autonome.
Des pixels au trottoir
Les tests ne sont pas une piste contrôlée. C’est la bonne voie. Les voitures roulent dans des environnements sans précédent. L’IA ne connaît pas certaines rues à l’avance. Il n’y a pas de motifs géométriques. Il repose entièrement sur des compétences acquises dans le vide.
Cela a fonctionné.
Il s’agit d’un événement révolutionnaire. C’est la première fois qu’une IA entraînée par apprentissage par renforcement dans un environnement 100 % virtuel est implémentée dans un véhicule physique. Le contrôleur était aveugle au monde réel jusqu’au moment critique.
L’équipe du MIT a construit bien plus qu’un simple outil. Ils ont présenté une méthode. L’écart entre la simulation et la réalité se réduit. Il ne s’agit pas d’ajouter des données humaines. Mais en laissant la machine apprendre dans le bac à sable numérique.
Que se passe-t-il ensuite ?
La prochaine étape est évidente. Les simulations actuelles nécessitent la prise en compte de plusieurs variables. Ciel. nuit. soleil. pluie. neige. L’équipe souhaite générer ces conditions à partir d’un seul fichier de trajectoire. Aucune nouvelle séquence requise.
Il est également prévu d’introduire des interactions complexes. Les autres véhicules ne sont pas de simples obstacles statiques. Leur comportement devient imprévisible. Ils réagiront.
Cette recherche a été publiée dans IEEE Robotics and Automation Letters. L’équipe du MIT prévoit d’ouvrir bientôt Vista en open source.
Ceci est important pour les amateurs qui comprennent la différence entre les couches convolutives et les modèles de transformateur. C’est au-delà de la phase « et si ». Nous voyons la première preuve concrète que l’entraînement synthétique peut survivre à une réalité chaotique.
Cette voiture passe le test. Il s’est adapté.
D’autres constructeurs suivront-ils cet exemple ? Le code arrive. La méthodologie est éprouvée. L’ère de la formation purement synthétique n’est plus une hypothèse. C’est sur la route.























