Note de l’éditeur : cet article fait partie de Into the Omniverse, une série consacrée à la façon dont les développeurs, les professionnels de la 3D et les entreprises peuvent transformer leurs workflows à l’aide des dernières avancées d’OpenUSD et de NVIDIA Omniverse.
En juillet, NVIDIA s’est joint à plus de 200 entreprises et organisations en signant Open Weights and American AI Leadership, une lettre ouverte affirmant que le leadership en matière d’IA ne se mesurera pas à l’aune d’un modèle de pointe en particulier, mais à celle de la capacité d’un écosystème ouvert à s’étendre à tous les secteurs.
Les modèles ouverts, que tout le monde peut télécharger, inspecter, modifier et exécuter sur sa propre infrastructure, sont ce qui rend cela possible. Cela n’est jamais plus crucial que dans l’IA physique, où chaque déploiement est un problème de spécialisation.
L’IA physique doit comprendre et prédire les conséquences, et pas seulement les apparences.
Pour rendre cela possible, les modèles de monde apprennent comment les environnements physiques se comportent, ce qui peut se passer ensuite et quelles actions suivantes ont un sens. Ils peuvent générer des données du monde et d’action physiquement ancrées, simuler des états futurs et fournir une base que les équipes peuvent spécialiser pour un robot, un véhicule autonome ou un système d’IA de vision.
Les modèles de monde ouverts sont déjà utilisés pour générer des données d’entraînement, tester des politiques et spécialiser les systèmes d’IA physique. NVIDIA Cosmos 3 regroupe ces capacités dans une famille de modèles ouverts, avec des résultats de référence et une adoption de premier plan dans les domaines de la robotique, des véhicules autonomes et de l’IA de vision.
Les bibliothèques NVIDIA Omniverse, qui font partie du NVIDIA Agent Toolkit, fournissent des capacités préconfigurées pour créer des mondes prêts pour la simulation que les équipes d’IA physique peuvent utiliser pour entraîner, tester et valider des systèmes avant le déploiement en conditions réelles.
Les modèles de monde sont la base de l’IA physique
Les données sous-jacentes à l’IA physique sont difficiles et coûteuses à collecter à l’échelle requise. Les événements rares et les scénarios à longue traîne peuvent être particulièrement difficiles à reproduire en toute sécurité et de manière répétitive.
Les modèles de monde permettent :
-
Des données plus utiles grâce à l’apprentissage des relations physiques à partir de scénarios multimodaux à grande échelle.
-
Environnements plus diversifiés qui varient en matière de météo, d’éclairage, d’objets et de trajectoires.
-
Une meilleure base sur laquelle s’appuyer et s’adapter à un robot, un véhicule, une configuration de capteur, une tâche ou un environnement d’exploitation particulier.
Un modèle général n’a pas été testé pour le robot, les capteurs ou l’environnement d’exploitation particulier d’une équipe. Combler cet écart nécessite un accès aux poids de modèles, à une licence permettant leur adaptation et aux outils nécessaires pour le post-entraînement.
Les modèles de fondation du monde NVIDIA Cosmos sont disponibles sous la licence OpenMDW 1.1 de la Linux Foundation, ce qui permet aux équipes de post-entraîner les modèles sur leurs propres données et matériel. La spécialisation est le domaine où l’ouverture devient une exigence technique pratique.
La spécialisation d’un modèle n’est qu’une partie du workflow. Les équipes ont également besoin d’environnements pour générer des données, exécuter des simulations et tester le comportement.
Les bibliothèques Omniverse aident les développeurs à créer des environnements prêts pour la simulation, tandis qu’OpenUSD fournit le framework ouvert pour composer, réutiliser et échanger des données 3D complexes entre des jumeaux numériques, des simulations et des workflows de génération de données synthétiques. Ensemble, Omniverse et OpenUSD réduisent les tâches redondantes qui peuvent autrement s’accumuler à chaque fois que les ressources, les configurations de capteurs ou les conditions environnementales changent.
Cosmos 3 : le Frontier Model
NVIDIA Cosmos 3, un omni-modèle d’IA physique ouvert et d’avant-garde, reposant sur une architecture mixture-of-transformers, combine le raisonnement visuel, la génération d’environnements et la prédiction d’actions, permettant ainsi aux développeurs d’utiliser une seule famille de modèles pour comprendre des scènes, générer des données synthétiques, simuler des états futurs et créer des modèles d’action du monde.
Les développeurs peuvent utiliser Cosmos 3 comme modèle de langage de vision, tant comme simulateur de monde basé sur la physique qui prédit les futurs états du monde et génère des données synthétiques à grande échelle, que comme colonne vertébrale pour les modèles d’action du monde, au lieu d’assembler et de gérer un modèle distinct pour chaque capacité.
La gamme comprend Cosmos 3 Super (64B) pour la modélisation du monde haute fidélité, Cosmos 3 Nano (16B) pour un raisonnement et un post-entraînement efficaces, ainsi que Cosmos 3 Edge (4B) pour le raisonnement de vision sur les appareils et le déploiement de politiques de robots. Suffisamment léger pour fonctionner sur des GPU à l’Edge, Cosmos 3 Edge peut être déployé sur des GPU NVIDIA RTX, des systèmes NVIDIA DGX et NVIDIA Jetson, notamment les plateformes Jetson Thor.
Dans les différents benchmarks, Cosmos 3 se classe n° 1 sur Artificial Analysis pour la génération de texte-en-image et d’image-en-vidéo à poids ouverts, sur PAI-Bench pour la génération de mondes et dans la catégorie « image-vidéo » de Physics-IQ. Pour la politique de robots, il se classe au premier rang sur RoboLab. Cosmos 3 Super est également le modèle ouvert le mieux classé sur VANTAGE-Bench pour la compréhension de la vision.
Outre Cosmos, la pile d’IA physique de NVIDIA inclut Isaac GR00T pour la robotique, Alpamayo pour les véhicules autonomes et Metropolis pour l’IA de vision.
Comment les développeurs mettent Cosmos 3 en œuvre
Dans tous les secteurs, les développeurs s’appuient sur NVIDIA Cosmos pour les applications d’IA physique : Doosan Robotics, LG Electronics, Samsung Electronics et Skild AI pour la robotique ; Li Auto, Xiaomi et Afari pour les véhicules autonomes ; et Centific, Fogsphere, Linker Vision, Milestone Systems et Yuan pour les agents d’IA de vision alimentant les applications d’IA industrielle et d’espaces intelligents.
La Coalition NVIDIA Cosmos prolonge ces travaux en réunissant des concepteurs de modèles de monde, des développeurs d’IA et des leaders de l’IA physique pour contribuer à des modèles, à la recherche et à des méthodes d’évaluation. NVIDIA a récemment étendu sa coalition au Japon, où les leaders de la robotique et de la fabrication ont l’intention de se joindre et de développer des modèles de monde ouverts pour les usines, la logistique, l’agriculture, la construction, la santé et les transports.
Ensemble, ces implémentations et collaborations établissent des modèles de monde ouvert en tant que base adaptable pour l’IA physique pour les robots, les véhicules autonomes et les systèmes d’IA de vision.
Connectez-vous
En savoir plus sur les modèles de monde, OpenUSD et le développement de l’IA physique en parcourant ces ressources :
-
Découvrez la collection de modèles ouverts Cosmos 3 et les jeux de données sur Hugging Face et GitHub.
-
Lisez le rapport technique sur Cosmos 3 pour plus de détails sur l’architecture et les évaluations.
-
Lisez le blog technique de Cosmos 3.
-
Suivez les livestreams de Cosmos Labs.
-
En savoir plus sur la Coalition NVIDIA Cosmos.
