NVIDIA Blackwell domine le classement du premier benchmark pour les infrastructures d’IA agentique

Les nouveaux résultats du benchmark AgentPerf réalisés par Artificial Analysis démontrent comment les systèmes de calcul accéléré excellent dans le traitement concret des charges de travail d'IA agentique, NVIDIA GB300 NVL72 étant à même d'exécuter jusqu'à 20 fois plus d'agents par mégawatt que NVIDIA Hopper.
by

AgentPerf d’Artificial Analysis, le tout premier benchmark de l’industrie dédié à l’IA agentique, fournit aux développeurs, aux entreprises et aux fournisseurs d’infrastructures un moyen clair de comparer les systèmes pour l’IA agentique. Dans la première série de résultats publiés, la plateforme NVIDIA Blackwell Ultra NVL72 offre des performances de pointe pour les charges de travail d’IA agentique testées, en exécutant 20 fois plus d’agents par mégawatt que NVIDIA Hopper.

L’IA agentique implique une charge de travail intrinsèquement différente par rapport à l’IA conversationnelle. Une seule complétion de chat est un sprint : un appel à un grand modèle de langage (LLM), une réponse. Un agent fonctionne davantage comme un relais : il décompose un objectif en plusieurs étapes et continue jusqu’à ce que la tâche soit terminée.

Les agents enchaînent plusieurs appels de LLM et appels d’outils pour collecter du contexte, observer, raisonner et agir.

Il en résulte des dizaines, voire des centaines, d’appels de LLM enchaînés, chacun transférant un contexte en pleine expansion à l’autre, avec des appels d’outils tels que la compilation et l’exécution de code, la recherche dans une base de données et la navigation sur le web à chaque transfert. La complexité n’est pas additive ; elle est multiplicative.

Cette distinction est extrêmement importante pour la mesure des performances. Les benchmarks d’inférence d’IA existants mesurent un appel de LLM, c’est-à-dire la vitesse à laquelle un LLM répond à une demande unique et le nombre de demandes simultanées qu’un système peut traiter. Ils n’ont pas été conçus pour les charges de travail agentiques, où les appels de LLM enchaînés, les délais d’appel d’outils et la pression croissante du contexte ont accéléré les systèmes informatiques de manières fondamentalement différentes de ce qu’un seul appel de LLM pourrait jamais faire.

Pour les entreprises qui conçoivent et déploient des agents à grande échelle, il est important de comprendre la réactivité des agents, le nombre d’agents qui peuvent être déployés simultanément et la quantité de travail utile que l’infrastructure d’IA peut fournir pour chaque dollar et chaque watt investis.

NVIDIA GB300 NVL72 exécute 20 fois plus d’agents par mégawatt

Au cours de ce premier cycle, AgentPerf mesure les performances agentiques avec DeepSeek V4 Pro, un grand modèle de mélange d’experts (MoE) qui représente la classe de modèles de pointe alimentant les agents les plus performants aujourd’hui. Sur cette charge de travail, NVIDIA GB300 NVL72 offre les performances les plus élevées du benchmark, en exécutant jusqu’à 20 fois plus d’agents par mégawatt que le système NVIDIA HGX H200.

NVIDIA GB300 NVL72 prend en charge nettement plus d’agents simultanés par mégawatt que NVIDIA H200 pour les deux objectifs de niveau de service de 20 et 60 tokens par seconde par agent.

L’avantage en termes de performances provient d’une co-conception extrême sur l’ensemble de la pile. GB300 NVL72 connecte 72 GPU dans un système unique à l’échelle du rack, ce qui permet aux grands modèles MoE comme DeepSeek V4 Pro de distribuer l’exécution du modèle efficacement à grande échelle.

Les noyaux CUDA accélèrent davantage ce processus en superposant la communication et le calcul. Ainsi, le coût de coordination entre les experts est absorbé plutôt que de s’ajouter à la latence.

NVIDIA TensorRT LLM maintient l’efficacité à mesure que les sessions d’agents simultanées évoluent. Par exemple, il sépare le traitement des entrées de la génération des sorties afin que chacun d’eux puisse être optimisé indépendamment.

Ces résultats s’appuient sur une méthodologie de référence conçue dès le départ pour refléter le fonctionnement réel de l’IA agentique en production.

AgentPerf d’Artificial Analysis repose sur de véritables charges de travail d’IA agentique

AgentPerf est conçu à partir de véritables trajectoires d’agents de codage : un agent reçoit une tâche, lit des fichiers, écrit et modifie du code, exécute des commandes et itère en fonction des résultats — le tout provenant de véritables dépôts de code publics dans plus de 12 langages de programmation. Les séquences de grande longueur, les schémas d’appel d’outils et les retards sont tous représentatifs des workflows de codage réels.

AgentPerf mesure ensuite le nombre de ces tâches reposant sur des agents qu’une plateforme donnée est en mesure de traiter simultanément tout en respectant des seuils de performance définis pour la réactivité et le taux de jetons de sortie. Les appels d’outils ne sont pas exécutés, mais simulés à l’aide d’un temps de traitement CPU représentatif. Par conséquent, les différences de résultats reflètent exclusivement les performances relatives au calcul accéléré.

Les résultats se traduisent directement en décisions d’infrastructure : combien de tâches agentiques simultanées peuvent être exécutées par accélérateur et par mégawatt de puissance. Pour les entreprises qui déploient des agents d’IA à grande échelle, ces chiffres déterminent la quantité de travail productif qu’un investissement dans une infrastructure donnée peut réellement fournir.

Les partenaires de l’écosystème NVIDIA mettent à profit les performances de pointe de la plateforme Blackwell

Les principaux fournisseurs d’inférence, notamment Baseten, DeepInfra et Together AI, exécutent déjà des charges de travail agentiques sur des modèles de pointe tels que DeepSeek V4 Pro sur NVIDIA Blackwell et alimentent aujourd’hui des applications agentiques en production.

Together AI propulse l’inférence en temps réel pour Cursor, une plateforme de codage agentique alimentée par l’IA, sur NVIDIA Blackwell. Les agents de Cursor déboguent les problèmes, génèrent des fonctionnalités et exécutent des refactorisations pendant que les développeurs continuent à travailler.

DeepInfra alimente Pam.ai, une plateforme de main-d’œuvre d’IA pour les concessions automobiles, qui permet de déployer des agents pour prendre des rendez-vous de service, gérer des appels et exécuter des campagnes de vente sortantes, entièrement sur NVIDIA Blackwell.

À mesure que NVIDIA et l’écosystème open source continuent à optimiser les logiciels d’inférence, les performances et l’efficacité sur les charges de travail agentiques ne feront que s’améliorer. L’architecture NVIDIA Vera Rubin est désormais en pleine production, apportant la nouvelle génération de capacités d’infrastructure pour répondre aux demandes croissantes de l’IA agentique à grande échelle.

Pour en savoir plus sur la méthodologie d’AgentPerf et les optimisations complètes de NVIDIA pour l’IA agentique, nous vous invitons à consulter cet article technique.