Note de l’éditeur : cet article fait partie de la série de blog Nemotron Labs qui explore comment les derniers modèles, ensembles de données et techniques d’entraînement ouverts aident les entreprises à créer des systèmes et des applications d’IA spécialisés sur les plateformes NVIDIA. Chaque article met en avant des moyens pratiques d’utiliser une pile ouverte pour créer de la valeur en production, des copilotes de recherche transparents aux agents d’IA évolutifs.
Les entreprises disposent d’un grand choix de modèles puissants. Le véritable test consiste à déterminer si l’IA développée par une entreprise répond de manière unique à ses besoins en améliorant les workflows, en tirant parti des connaissances relatives au domaine et en dépassant les normes en matière de précision et de confiance.
De plus en plus, l’avantage concurrentiel en matière d’IA repose davantage sur la manière dont les entreprises utilisent les modèles disponibles que sur le choix du modèle lui-même.
Les modèles ouverts tels que NVIDIA Nemotron sont conçus pour la personnalisation, ce qui permet aux entreprises et aux pays de créer une IA contrôlable, fiable et adaptée à leurs besoins.
De l’utilisation de l’IA à la possession de l’intelligence
L’IA spécialisée, telle que les agents et les applications autonomes, est conçue avec des modèles ouverts personnalisés. Ces agents sont conçus pour effectuer correctement une tâche définie, car les modèles utilisés sont optimisés selon des connaissances propriétaires et évalués en fonction de résultats commerciaux réels.
Cela nécessite un accès au modèle lui-même. Les modèles fermés repoussent les limites du possible et continuent de faire progresser les frontières de l’intelligence générale, mais ils fixent également un plafond pour ce que les entreprises peuvent inspecter, affiner et améliorer. Les modèles ouverts éliminent cette barrière, offrant une propriété et un contrôle complets.
Les applications d’IA agentique les plus efficaces sont des systèmes de modèles où les modèles ouverts fonctionnent aux côtés des principaux modèles de pointe, chacun accomplissant la tâche qu’il fait le mieux. Les modèles de raisonnement à haute performance peuvent gérer une planification complexe, tandis que les modèles de plus petite taille sont utilisés pour des tâches spécialisées. Cela permet aux entreprises d’ajuster précisément leurs coûts d’inférence, d’améliorer la précision pour des tâches spécifiques et de conserver leur flexibilité à mesure que les workflows évoluent.
Une personnalisation à laquelle les entreprises peuvent faire confiance
Les modèles ouverts offrent aux entreprises un avantage que les modèles fermés ne peuvent pas égaler : un contrôle total leur permettant de personnaliser, d’inspecter et d’améliorer l’IA en fonction de leurs besoins métier. Les benchmarks publics mesurent les capacités générales — mais les évaluations spécifiques à l’entreprise permettent aux équipes de tester par rapport à leurs propres données, workflows et définition de la précision — pour ensuite s’améliorer sur cette base.
Par exemple, le coût d’une réponse erronée est élevé dans des secteurs tels que la santé et le droit, où les équipes gèrent des données sensibles et sont confrontées à des exigences de précision strictes. Les entreprises de ces secteurs doivent avoir une visibilité sur la façon dont un modèle a été entraîné, sur ses performances et sur la possibilité de l’améliorer si nécessaire.
Grâce aux modèles ouverts, les équipes peuvent inspecter leurs applications, effectuer des évaluations privées selon leurs propres critères et mettre en place des environnements d’apprentissage par renforcement adaptés à leurs propres workflows. Aucun acheminement de leurs données propriétaires par un tiers n’est requis.
Les entreprises de tous les secteurs spécialisent déjà Nemotron pour leurs domaines respectifs :
- Abridge personnalise Nemotron pour créer le premier modèle de fondation spécialement conçu pour les conversations cliniques.
- Glean a créé Waldo, un modèle de recherche agentique qui associe Nemotron à des modèles fermés plus grands afin d’offrir une recherche d’entreprise avec une latence nettement réduite et une consommation moindre de jetons.
- H Company a conçu Holotron 3 Nano en effectuant un post-entraînement de Nemotron 3 Nano Omni sur des données propriétaires d’utilisation informatique, atteignant une précision supérieure à 76 % sur OSWorld-Verified (une référence pour les tâches informatiques) tout en égalant d’autres modèles de pointe pour une fraction du coût.
- Harvey a post-entraîné Nemotron 3 Ultra sur son benchmark juridique et a atteint une précision de niveau frontière, égalant les principaux modèles fermés sur des tâches juridiques complexes pour un coût d’exécutionau moins 10 fois inférieur.
- Heidi Health fournit des résultats de haute qualité en matière de documentation clinique sans nécessiter une capacité de calcul comparable à celle des modèles de pointe.
- YTL AI Labs a post-entraîné un modèle Nemotron pour la langue malaise, mettant ainsi une IA personnalisée localement à la disposition de la communauté des développeurs malaisiens afin de faire progresser leurs capacités en intelligence artificielle.
Environnements de fine-tuning et coûts d’exécution optimaux
La personnalisation améliore la précision. Lorsque les modèles sont optimisés pour un cadre d’évaluation ou un domaine précis, ils offrent également une meilleure efficacité d’exécution.
La suite de bibliothèques ouvertes NVIDIA NeMo accélère la personnalisation et l’évaluation de modèles, ainsi que l’optimisation et la gouvernance des agents.
Des partenaires tels que Prime Intellect et Unsloth permettent déjà la personnalisation de l’IA pour les entreprises qui créent des pipelines de post-entraînement sur Nemotron, ce qui permet d’exécuter une IA spécialisée à grande échelle.
LangChain a optimisé son infrastructure Deep Agents pour Nemotron 3 Ultra (en ajustant les requêtes, les outils et les middlewares, sans post-entraîner le modèle) et a obtenu la meilleure précision agentique parmi les modèles ouverts, avec un coût par exécution environ 10 fois inférieur à celui des principales alternatives fermées.
Ces avantages en matière de coûts s’étendent également à l’infrastructure, permettant une évolutivité optimale. Grâce au post-entraînement de Nemotron sur la plateforme NVIDIA Blackwell, Arcee AI a réduit le coût d’inférence à environ 90 centimes par million de jetons de sortie, soit environ 20 fois moins que des modèles fermés de pointe comparables, tout en obtenant la deuxième place sur PinchBench avec des poids entièrement ouverts.
La réduction des coûts favorise une expérimentation plus large, multiplie les possibilités de déploiement et accélère les cycles d’itération.
Construire un écosystème sur un socle ouvert
Le passage de l’adoption de l’IA à l’appropriation de l’IA est en cours. La Coalition NVIDIA Nemotron contribue à transformer le développement de modèles ouverts en un effort écosystémique, en réunissant les concepteurs de modèles et les développeurs pour améliorer Nemotron grâce au partage de données, d’évaluations et d’expertise dans le domaine. En outre, les projets issus des hackathons et les contributions communautaires créent des ressources démontrant la valeur de ces approches, réutilisables dans tous les secteurs.
Les concepteurs intègrent Nemotron à leurs systèmes d’IA, prouvant ainsi sa valeur et partageant ce qui fonctionne. La fondation est entièrement ouverte.
En savoir plus sur les modèles ouverts NVIDIA Nemotron et testez-les sur build.nvidia.com.
