O simulador Vista do #MIT prova que o aprendizado por reforço funciona em estradas reais
O treinamento em carros autônomos tem grandes pontos cegos. A indústria depende de dados coletados de motoristas humanos há anos. Ideal para o dia a dia, como deslocamentos e engarrafamentos. Mas quando as coisas dão errado, ele falha catastroficamente. Você não pode pedir a um humano que passe por um quase acidente apenas para ensinar a máquina. Não estamos pedindo às pessoas que arrisquem suas vidas para obter dados. Isso deixa uma lacuna. O caso extremo definitivo. Este é o momento em que os reflexos se tornam mais importantes que a vida diária.
A simulação preenche essa lacuna. Cria uma situação infinitamente variável e perigosa que nunca aconteceria na realidade. Só há um problema. Até agora, os sistemas treinados inteiramente em simuladores não conseguiram conduzir carros reais em estradas reais. Esta é uma ponte de tráfego teórica.
A situação mudou recentemente. Uma equipe de pesquisadores do Instituto de Tecnologia de Massachusetts (MIT) construiu um simulador realista chamado Vista (Síntese e Transformação de Imagem Virtual para Autonomia ). Eles dirigiram.
Como o Vista cria uma realidade infinita
O Vista faz mais do que apenas desenhar gráficos. Reconstrua a física. O grupo começou com imagens do mundo real. Esta é a âncora. Mas a mágica acontece durante o processamento.
O mecanismo de renderização renderiza cada pixel como uma nuvem de pontos 3D. Profundidade do mapa. Distância do mapa. Ele mapeia o movimento. Em seguida, coloque seu veículo virtual neste espaço digital.
É aqui que as redes neurais assumem o controle. Cena de processamento de redes neurais convolucionais. Calcule a profundidade de campo. Preveja como cada objeto se moverá em relação ao carro. O sistema sintetiza novas rotas de voo com base nessas informações. Não se trata apenas de reproduzir vídeos. Crie um novo caminho no espaço 3D.
O controlador não está conectado ao carro real. Nunca viu a estrada. Não tem conhecimento de como os humanos dirigem.
Este processo se repete. O sistema cria cenas realistas com base em trajetórias de voo calculadas. Não é um ativo pré-registrado. Gerado imediatamente. Isso permite variações infinitas. Você pode mudar o clima. Você pode alterar a iluminação. Você pode alterar o comportamento de outros agentes virtuais. Tudo das gravações originais.
Educação para cegos
O objetivo dos drivers de IA é simples. Fique na pista. Não bata.
é isso.
A princípio, a IA não sabe nada sobre direção. Ele não sabe o que uma roda faz. Não sabe o que significa um semáforo. Trabalhe dentro das restrições básicas. Se você bater, receberá um sinal de penalidade. Este é o aprendizado por reforço em ação.
O sistema aprende por tentativa e erro. Após cada falha, o emulador altera o ambiente. Uma nova variável é introduzida. Forçar a IA a se adaptar. Não é fornecido um livro de regras. Dá feedback.
O modelo é concluído após 10.000 quilômetros de condução simulada. A equipe instalou um motorista treinado em um carro autônomo real.
Dos pixels ao pavimento
O teste não é uma pista controlada. Este é o caminho certo. Os carros circulam em ambientes sem precedentes. A IA não conhece determinadas ruas com antecedência. Não existem padrões geométricos. Baseia-se inteiramente em habilidades aprendidas no vazio.
Funcionou.
Este é um evento inovador. Esta é a primeira vez que a IA treinada por meio de aprendizagem por reforço em um ambiente 100% virtual é implementada em um veículo físico. O controlador estava cego para o mundo real até o momento crítico.
A equipe do MIT construiu mais do que apenas uma ferramenta. Eles apresentaram um método. A lacuna entre a simulação e a realidade está diminuindo. Não se trata de adicionar dados humanos. Mas deixando a máquina aprender na sandbox digital.
O que acontece a seguir?
O próximo passo é óbvio. As simulações atuais exigem a consideração de diversas variáveis. Céu. noite. sol. chuva. neve. A equipe gostaria de gerar essas condições a partir de um único arquivo de trajetória. Nenhuma nova filmagem é necessária.
Também há planos para introduzir interações complexas. Outros veículos não são apenas obstáculos estáticos. Seu comportamento se torna imprevisível. Eles vão reagir.
Esta pesquisa foi publicada na IEEE Robotics and Automation Letters. A equipe do MIT planeja abrir o código-fonte do Vista em breve.
Isto é importante para amadores que entendem a diferença entre camadas convolucionais e modelos de transformadores. Está além da fase “e se”. Estamos a ver a primeira evidência concreta de que o treino sintético pode sobreviver a uma realidade caótica.
Este carro passa no teste. Adaptou-se.
Outros fabricantes seguirão o exemplo? O código está chegando. A metodologia está comprovada. A era do treinamento puramente sintético não é mais uma hipótese. Está na estrada.























