Alors que l’IA évolue des chatbots vers les agents autonomes, les modèles ouverts répondent aux attentes du marché en matière de contrôle total sur les environnements d’exécution de l’IA, ainsi que sur son déploiement et son évolution.
Aujourd’hui, NVIDIA enrichitsa famille de modèles Nemotron 3 avec Nemotron 3.5 Lightning, le modèle le plus efficace de sa catégorie pour les charges de travail d’IA agentique de longue durée. Cette version succède à Nemotron 3 Nano et illustre l’engagement de NVIDIA à améliorer continuellement ses modèles ouverts afin d’en accroître la précision et la vitesse.
Conçu pour des tâches spécialisées au sein de systèmes multi-agents plus vastes, Nemotron 3.5 Lightning, un modèle de mixture-of-experts à 30 milliards de paramètres, contribue à créer des applications agentiques plus intelligentes et plus efficaces.
Par ailleurs, NVIDIA dévoileNeMo Switchyard, une bibliothèque open source de routage intelligent au sein des principaux outils d’agents. Les entreprises peuvent l’utiliser pour créer un routeur adapté à leurs besoins spécifiques. Une fois déployé, NeMo Switchyard peut diriger intelligemment chaque requête vers le modèle le plus performant et le plus adapté à la tâche, sans obliger les développeurs à réécrire leurs applications.
Ensemble, Nemotron 3.5 Lightning et NeMo Switchyard offrent un contrôle accru sur la manière dont l’IA est déployée, sur l’endroit où elle s’exécute et l’efficacité avec laquelle elle fonctionne — sur les PC, les stations de travail, les centres de données et le cloud.

Figure 1. Nemotron 3.5 Lightning offre une intelligence de niveau frontier dans un modèle ouvert compact et personnalisable, conçu pour les flux de travail agentiques à grand volume.
Les agents toujours actifs ont besoin d’un système de modèles
Les systèmes agentiques modernes — les agents toujours actifs — fonctionnent de plus en plus comme des systèmes de modèles, ou ensembles de modèles, différents modèles étant spécialisés dans différentes tâches.
Les modèles ouverts NVIDIA Nemotron sont conçus pour cette architecture. Un modèle de raisonnement de pointe tel que Nemotron 3 Ultra ou GPT-5.6 peut planifier et orchestrer un workflow, tandis que des modèles spécialisés plus petits comme Nemotron 3.5 Lightning peuvent exécuter des tâches ciblées telles que la revue de code, l’utilisation d’outils, la surveillance des alertes de sécurité et la réponse aux questions de facturation.
Exécution de tâches spécialisées à haut volume avec Nemotron 3.5 Lightning
NVIDIA Nemotron 3.5 Lightning est un modèle ouvert entièrement personnalisable, conçu pour les tâches à haut volume qui alimentent des agents fonctionnant en continu. Il a été développé avec les contributions de la Coalition Nemotron, dont les membres ont fourni des méthodologies d’évaluation, des logiciels d’inférence et des jeux de données afin de faire progresser le modèle.
Le modèle offre une vitesse de génération jusqu’à 4 fois supérieure, ce qui permet d’accomplir les tâches agentiques 30 % plus rapidement par rapport à d’autres modèles de sa catégorie. Et parce qu’il est ouvert et personnalisable, Nemotron 3.5 Lightning peut être facilement post-entraîné avec NVIDIA NeMo sur les données de domaine, les outils et les workflows propres à une organisation, afin d’améliorer la précision pour des tâches spécialisées.

Figure 2. Les évaluations PinchBench démontrent que Nemotron 3.5 Lightning accomplit les tâches agentiques plus rapidement, avec une précision de niveau frontier par rapport aux autres modèles de sa catégorie.
Des leaders de l’IA dans tous les secteurs personnalisent Nemotron 3.5 Lightning pour leurs charges de travail, notamment CrowdStrike pour la cybersécurité, Harvey avec Trajectory pour les services juridiques et CodeRabbit avec Baseten pour la revue de code, contribuant à améliorer la précision des tâches agentiques propres à chaque domaine. Par ailleurs, Lila Sciences contribue à améliorer les capacités de raisonnement pour les tâches agentiques dans les sciences physiques et les sciences de la vie, et Fastino Labs a personnalisé le modèle et constate des niveaux de précision de premier plan pour les charges de travail de développement logiciel,de finance et de santé.

Figure 3. Des entreprises ont personnalisé Nemotron 3.5 Lightning afin d’atteindre une précision de premier plan pour leurs tâches spécialisées au sein de leurs flux de travail agentiques.
Nemotron 3.5 Lightning donne également aux organisations le contrôle de la confidentialité et du déploiement. Le modèle peut fonctionner sur des systèmes d’IA locaux — notamment les PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station et NVIDIA Jetson — afin d’aider les utilisateurs à maximiser leurs investissements existants en infrastructure, ou à passer à l’échelle sur des dispositifs edge AI, des stations de travail NVIDIA RTX PRO, des centres de données et des environnements cloud pour les cas d’usage en entreprise. Et Nemotron 3.5 Lightning peut fonctionner localement ou sur site pour des tâches spécialisées à haut volume qui nécessitent des réponses rapides.
En outre, comme pour chaque lancement Nemotron, NVIDIA publie autant de données et de techniques d’entraînement que les licences le permettent, ce qui permet la traçabilité, l’audit et l’entraînement d’autres modèles. Parallèlement à Lightning, NVIDIA met à disposition Nemotron-RL-Agentic-Terminal-Pivot, un jeu de données agentique d’ apprentissage par renforcement utilisé pour son post-entraînement afin de doter le modèle de capacités d’agent de codage.
Des applications d’IA plus efficaces grâce au routage de modèles
Certains modèles sont plus adaptés au codage, d’autres au raisonnement, d’autres encore aux tâches légères, et certains sont optimisés pour une exécution locale afin d’offrir davantage de confidentialité et d’efficacité. Si les clients s’appuient sur un seul modèle par défaut, ils risquent soit de dépenser excessivement, soit de perdre en qualité ; s’ils gèrent le routage manuellement, cela devient un travail d’intégration susceptible de ralentir un déploiement.
NVIDIA NeMo Switchyard est une bibliothèque open source de routage de modèles destinée aux agents IA. Cette technologie achemine les prompts vers le modèle le plus performant et le plus efficace pour chaque étape d’un workflow d’agent automatiquement, selon les besoins spécifiques. Les développeurs d’applications agentiques peuvent affinerou modifier le routeur avec différents algorithmes de routage pour répondre à leurs priorités, telles que les exigences de qualité, de latence et de coût. Dans un système de modèles, les entreprises peuvent créer des agents IA puissants avec une tokenomique améliorée.
Les benchmarks internes montrent que NeMo Switchyard conserve une précision de niveau frontier tout en réduisant le coût d’exécution des tâches à près d’un tiers de celui d’Opus 4.8 seul.

Figure 4. Les benchmarks internes de NVIDIA montrent que NeMo Switchyard conserve une précision de niveau frontier tout en réduisant le coût d’exécution des tâches à près d’un tiers de celui d’Opus 4.8 seul.
NVIDIA collabore avec des partenaires de l’ensemble de l’écosystème IA afin d’intégrer le routage intelligent de modèles dans les outils et les plateformes que les développeurs utilisent déjà.
- Boomi: Évaluation de Switchyard sur cinq capacités de routage, avec une précision de routage par domaine de 100 %, 59 % du trafic acheminé vers un modèle affiné 5 fois plus rapide et une réduction de 21 % de la latence des tours ultérieurs.
- Cadence: efficacité améliorée de 9.9% grâce à l’utilisation du ChipStack AI Super Agent pour un cas d’usage de vérification formelle.
- Classmethod: Exécute opencode et des charges de travail Fireworks en interne à l’aide de NeMo Switchyard, les premiers tests faisant état d’une réduction des coûts de 27 % tout en maintenant la qualité.
- Cognition: A intégré le routeur étagé NVIDIA NeMo Switchyard à Devin Desktop pour un usage interne chez NVIDIA, atteignant des performances proches de celles des modèles de pointe sur FrontierCode Main tout en réduisant le coût moyen de 28 % par rapport à l’acheminement de toutes les requêtes vers un seul modèle de pointe sous-jacent.
- Kong: Propose un routage avec NeMo Switchyard, nativement via Kong AI Gateway.
- LangChain: Avec NeMo Switchyard, a obtenu une réduction des coûts de 74 % sur 145 tâches Deep Agents multitours en acheminant que 7 % des appels vers un modèle de pointe, pour une perte de précision de 6 %.
- LiteLLM: intègre le routage dans sa couche proxy afin que les développeurs puissent bénéficier de ces avantages sans modifier leur stack existante.
- Nous Research: A intégré NeMo Switchyard à Hermes afin de fournir aux développeurs un système de routage facile à configurer pour améliorer l’efficacité des agents.
- Ramp: a utilisé NeMo Switchyard pour égaler les performances d’un modèle de pointe tout en réduisant les coûts de 58 % et le temps d’exécution de 33 % dans Ramp SWE-Bench.
- Siemens: réalise des tests comparatifs afin d’améliorer l’efficacité de son Fuse EDA AI Agent.
Nemotron 3.5 Lightning est disponible sur Hugging Face, ModelScope, OpenRouter et build.nvidia.com sous la forme d’un microservice NVIDIA NIM, ainsi qu’auprès d’un vaste écosystème de partenaires cloud NVIDIA, de plateformes de post-entraînement, de plateformes d’inférence et de fournisseurs de services cloud. NeMo Switchyard est disponible sur GitHub et sera prochainement proposé sur les plateformes partenaires.
