Deux catégories de modèles sont souvent confondues dans les discussions en robotique : les modèles vision-langage et les modèles vision-langage-action. Leurs appellations se ressemblent : tous deux traitent des images et du texte, et ils partagent la même approche de pré-entraînement multimodal. Pourtant, pour quiconque souhaite déployer un système d’IA capable d’interagir avec le monde physique – et non pas seulement de le décrire –, cette distinction est cruciale. VLM vs VLA : la différence réside entre un modèle qui comprend une scène et un modèle qui interagit avec le monde physique.

Points clés à retenir
- Les VLM associent des images et du texte à des sorties linguistiques ; les VLA les associent à des actions robotiques.
- Les VLM ne peuvent pas actionner directement un moteur, une pince ou un effecteur terminal.
- Les VLA étendent les VLM avec des jetons d'action entraînés sur des données de démonstration de robots.
- La plupart des architectures VLA peaufinent une infrastructure VLM lors d'épisodes de démonstration.
- La robotique de niveau déployable nécessite des données d'entraînement de type VLA, et non uniquement des données VLM.
- Confondre les deux conduit à surestimer ce qu'un modèle de perception peut faire en production.
Qu'est-ce qu'un VLM ?
Un modèle vision-langage (VLM) est un réseau neuronal multimodal qui prend en entrée des images et du texte et produit des sorties textuelles ou structurées. Les VLM sont entraînés à grande échelle sur des paires image-texte et excellent dans la génération de légendes, la réponse à des questions visuelles et le raisonnement visuel.
VLM : Un modèle multimodal qui consomme des entrées visuelles et linguistiques et produit des sorties linguistiques ou symboliques, telles que des légendes, des classifications ou des chaînes de raisonnement.
Les VLM sont puissants, mais leur espace de sortie est symbolique, non physique. Ils peuvent décrire ce qui se passe dans une cuisine, identifier un objet ou répondre à des questions sur une scène. Ils ne peuvent rien saisir physiquement.
Qu'est-ce qu'un VLA ?
Un modèle VLA (vision-langage-action) est un modèle multimodal qui traite des entrées visuelles et linguistiques et produit des séquences d'actions robotiques. L'espace de sortie comprend des commandes motrices, des poses de l'effecteur terminal ou des jetons d'action qui sont décodés en signaux de contrôle continus.
VLA : Un modèle de base robotique qui émet des actions, et non du texte — généralement des jetons de mouvement discrets qui correspondent aux degrés de liberté d'un robot.
Dans l'un des articles fondateurs de ce paradigme, RT-2 a optimisé les architectures vision-langage à partir de données de démonstration de robots et a produit des jetons d'action discrétisés (DeepMind, 2023). Cette transition de sortie — du texte à l'action — constitue l'intégralité de la différence architecturale.
En quoi les données d'entraînement VLM et VLA diffèrent-elles ?
Les données d'entraînement VLM et VLA diffèrent par le contenu de chaque exemple. Un exemple VLM associe une image à une légende ou à une question-réponse. Un exemple VLA associe une image à une instruction et à une trajectoire d'action basée sur une incarnation robotique spécifique.
Une analogie utile : un VLM est comme un analyste sportif capable de décrire chaque action en détail, mais qui n’a jamais touché un ballon. Un VLA, lui, est le joueur. L’expertise de l’analyste est réelle et précieuse, mais elle ne remplace pas la pratique. Les données d’entraînement du VLA correspondent à cette pratique : observations synchronisées, instructions linguistiques, étiquettes d’actions et marqueurs de résultats, répétés sur des millions d’épisodes.
Pourquoi ne pas simplement utiliser un VLM pour la robotique ?

En pratique, de nombreuses équipes transforment les VLM en VLA en enrichissant le vocabulaire de sortie avec des jetons d'action — des unités de mouvement discrétisées traitées comme des mots. Cela préserve le raisonnement du VLM tout en lui permettant d'agir.
Jeton d'action : Un mouvement robotique discrétisé, encodé sous forme d'entrée de vocabulaire qu'un modèle peut prédire de la même manière qu'il prédit un jeton linguistique.
Imaginez une start-up logistique qui acquiert une licence pour un modèle de localisation virtuelle (VLM) de haute qualité et pense pouvoir piloter un robot de prélèvement et de placement. Le modèle perçoit parfaitement la scène, décrit le plan d'action adéquat et ne génère aucune commande motrice. Sans apprentissage par jetons d'action, le système reste bloqué à cette étape. L'ajout de données VLA permet le déploiement.
VLM vs VLA : côte à côte
| Dimension | VLM | VLA |
|---|---|---|
| Entrée | Images + texte | Images + texte + (souvent) état du robot |
| Sortie | Langage / symbolique | Jetons d'action / commandes motrices |
| Données d'entraînement | paires image-texte | Épisodes avec trajectoires d'action |
| Cas d'utilisation | Sous-titrage, VQA, raisonnement | Robotique, autonomie, IA incarnée |
| Mode de réalisation | Aucun | Lié à un robot ou une famille spécifique |
| Évaluation | Précision, BLEU, utilité | Réussite de la tâche, généralisation OOD, sécurité |
Quand faut-il utiliser chacun d’eux ?
Utilisez un VLM lorsque la tâche se termine par une description, une décision ou une réponse textuelle. Utilisez un VLA lorsque la tâche se termine par une action physique.
Dans les systèmes hybrides, les deux ont un rôle à jouer. Les VLM gèrent la compréhension de scène de haut niveau, la conversation et le raisonnement. Les VLA gèrent le contrôle en boucle fermée. De nombreuses architectures de production utilisent un VLM comme planificateur et un VLA comme exécutant, parfois dans des conceptions à double système qui échangent des représentations latentes entre les deux. Cette distinction est importante car ils nécessitent des données d'entraînement, des critères d'évaluation et des contrôles de qualité fondamentalement différents. services de vision par ordinateur et IA physique Les opérations sur les données couvrent les deux extrémités de ce spectre.
Conclusion
L'opposition entre VLM et VLA n'est pas une compétition, mais une répartition des tâches. Les deux sont essentiels à l'IA incarnée et dépendent de données d'entraînement adaptées à leur fonction. Choisir le bon modèle, c'est l'associer au bon espace de sortie et à l'ensemble de données approprié.
Que signifie VLA en robotique ?
VLA signifie vision-langage-action ; il s’agit d’une classe de modèles qui reçoivent des entrées visuelles et linguistiques et produisent des actions robotiques. La composante « action » est leur caractéristique principale : c’est ce qui distingue les modèles VLA des modèles vision-langage plus anciens qui ne produisent que du texte ou des sorties symboliques.
Un VLM peut-il être transformé en VLA ?
Un VLM peut être transformé en VLA grâce à un paramétrage fin sur des données de démonstration robotique enrichies d'un vocabulaire étendu de jetons d'action. La plupart des VLA modernes sont construits de cette manière, préservant le raisonnement du VLM tout en lui apprenant à émettre des commandes motrices. Cette étape de paramétrage fin requiert des jeux de données de haute qualité alignés sur les actions, et non pas simplement du texte supplémentaire.
Un VLA est-il simplement un VLM avec une tête différente ?
Un VLA est plus qu'un VLM doté d'une interface différente. Si de nombreuses architectures partagent la structure de base du VLM, les VLA y ajoutent des décodeurs d'actions, une tokenisation prenant en compte l'incarnation et des fonctions de perte liées au contrôle physique. Certaines conceptions découplent la planification et l'exécution en modules VLM et VLA distincts qui échangent des représentations latentes.
Quel est le test VLM vs VLA le plus simple ?
Le test le plus simple pour distinguer un modèle VLM d'un modèle VLA consiste à examiner la sortie du modèle. Si la sortie est une phrase, une légende, une classification ou une chaîne de raisonnement, il s'agit d'un modèle VLM. Si la sortie est une commande moteur, un angle articulaire ou un jeton d'action pilotant un robot, il s'agit d'un modèle VLA. C'est l'espace de sortie, et non la modalité d'entrée, qui définit la classe.
Les VLA ont-ils besoin de plus de données que les VLM ?
Les VLA nécessitent généralement des données plus structurées et mieux organisées que les VLM, même lorsque le nombre total de jetons est inférieur. L'entraînement des VLM exploite des paires image-texte bruitées à l'échelle du web. L'entraînement des VLA requiert des trajectoires d'actions, un alignement linguistique à la granularité de l'épisode et des étiquettes de succès explicites ; autant d'éléments qui exigent des processus de collecte et d'annotation structurés.
Les benchmarks VLM sont-ils utiles pour l'évaluation VLA ?
Les benchmarks VLM sont d'une utilité limitée pour l'évaluation VLA. La précision du sous-titrage et la réponse aux questions visuelles mesurent la perception et le raisonnement, et non le contrôle. L'évaluation VLA repose sur le taux de réussite des tâches, la généralisation à des objets et environnements inconnus, et les performances dans des scénarios à niveaux de sécurité — des indicateurs qu'aucun benchmark VLM ne prend actuellement en compte.





