Les innovateurs de l’IA adoptent NVIDIA Vera — Pourquoi le CPU monothread maximal à grande échelle est essentiel

NVIDIA Vera représente une nouvelle catégorie de CPU pensée pour l’ère des agents d’IA, déjà adoptée par des acteurs innovants comme Perplexity. NVIDIA poursuit cette feuille de route avec Rosa et son cœur Rigel.
by

Les CPU Max monothread à grande échelle constituent une nouvelle catégorie de CPU conçus pour l’ère de l’IA agentique.

Lors de la conception et du déploiement d’un système agentique, le CPU joue un rôle essentiel dans le raisonnement, la latence des réponses et l’apprentissage. Les CPU sont les processeurs qui exécutent les tâches commandées par le modèle d’IA : appel d’outils, exécution de code, traitement des données, cache KV et analyse des résultats.

Pour les agents des usines d’IA, la vitesse est importante.

Plus le CPU peut exécuter l’outil rapidement, plus l’agent peut accomplir rapidement la tâche en cours.

Pour l’usine d’IA, l’utilisation du GPU est la ressource la plus précieuse du data center, de sorte que tout temps d’attente pour l’achèvement d’une tâche limite les revenus de l’usine d’IA — ou pire, impacte l’utilisation du GPU en attendant que le CPU termine sa tâche. Les usines d’IA nécessitent un CPU offrant des performances maximales en monothread pour maximiser les revenus des usines d’IA et la performance des agents.

Les CPU actuels des data centers ne sont pas conçus pour offrir des vitesses à grande échelle.

Alors que le monde dispose de CPU rapides pour les PC et les stations de travail, les CPU des centres de données ont évolué dans des directions s’éloignant des performances en monothread. L’avènement du Cloud a poussé les fabricants de CPU à concevoir des CPU à forte densité de cœurs tout en minimisant les coûts au détriment des performances.

La conception de processeurs qui optimisent les coûts par cœur pouvant être loué a permis d’augmenter le nombre de cœurs par puce tout en réduisant la surface de silicium allouée aux éléments qui assurent la rapidité de ces cœurs, tels que les structures de mémoire haute performance et le traitement plus rapide des instructions par cœur. Le passage à des architectures basées sur des chiplets a encore réduit les coûts, mais a également introduit une « taxe sur les chiplets » : les cœurs de chaque CPU ne peuvent plus accéder à l’intégralité des performances mémoire de la puce.

Les agents d’IA ont besoin d’un CPU conçu pour fournir des performances maximales en monothread à grande échelle.

Un CPU offrant des performances monothread maximales à grande échelle permet de maintenir la rapidité de chaque étape de l’agent, même lorsque le système fonctionne à pleine charge. Chaque cœur accomplit la tâche de l’agent à pleine performance sans que les autres cœurs ne le ralentissent. Les CPU offrant des performances monothread maximales à grande échelle sont conçus différemment pour fournir :

  • Des performances élevées par cœur sous charge
  • Une bande passante mémoire par cœur suffisante pour alimenter en permanence les cœurs actifs avec les données dont ils ont besoin
  • Une latence prévisible

Chaque cœur peut exécuter sa tâche sans subir de ralentissement lié aux autres cœurs, ce qui permet d’atteindre un débit exceptionnel et, surtout, les performances monocœur les plus élevées possibles.

NVIDIA Vera est le parfait exemple de cette nouvelle classe de conception de CPU.

Comment les CPU Max à thread unique à grande échelle sont conçus pour exécuter la boucle agentique

Un agent d’IA ne s’arrête pas après une seule requête. Il agit en boucle. Le modèle raisonne sur l’étape suivante. Le CPU exécute le travail autour du modèle. Le résultat est renvoyé. Le modèle décide de la suite des opérations. La boucle se poursuit ensuite.

Ce modèle crée un profil de demande pour lequel les CPU conventionnels n’ont pas été optimisés. Le travail CPU traditionnel est intermittent et piloté par l’utilisateur, composé d’interactions courtes déclenchées par des personnes. Le travail agentique est à la fois persistant et parallèle : des essaims d’agents s’exécutent en continu, chacun progressant à travers une chaîne d’étapes où chaque étape dépend du résultat de la précédente.

Plus de cœurs dans un CPU signifie davantage de tâches d’agents par CPU, et les CPU des centres de données nécessitent un grand nombre de cœurs pour maximiser le débit des tâches.

Cependant, l’ajout de cœurs supplémentaires à un CPU ne peut pas réduire le temps nécessaire pour chaque étape au sein d’une boucle d’agents unique. Un plus grand nombre de cœurs ne permet pas d’accélérer l’exécution d’une tâche individuelle. En réalité, les CPU optimisés pour augmenter le nombre de cœurs peuvent dégrader les performances individuelles des cœurs lorsque ceux-ci se disputent les mêmes ressources.

Les performances individuelles par cœur sont importantes pour accélérer l’exécution de chaque étape. Le débit des cœurs supplémentaires est utile, mais insuffisant. Comme chaque action dépend du résultat précédent, la vitesse par cœur détermine la rapidité d’avancement de la boucle.

En définitive, un CPU conçu pour l’IA agentique doit offrir les meilleures performances monothread par cœur, chaque cœur devant maintenir ce niveau de performance sans compromis. Dans ce monde, chaque seconde compte. Les agents comptent en nanosecondes. NVIDIA Vera est conçu pour cette nouvelle catégorie et vitesse de travail.

NVIDIA Vera est le CPU en monothread le plus performant à grande échelle pour les agents

NVIDIA Vera est un CPU monothread de pointe à grande échelle, conçu de A à Z pour la boucle agentique : le travail effectué entre les appels de modèles, lorsque les agents utilisent des outils, traitent des données, exécutent du code et vérifient les résultats.

Le CPU NVIDIA Vera.

Olympus, le cœur de processeur personnalisé de NVIDIA, est au cœur de Vera et offre un nombre d’instructions par cycle 50 % supérieur à celui de NVIDIA Grace. Cela est important, car de nombreuses étapes des agents sont séquentielles. Un appel d’outil, une exécution de code, un test ou une étape de traitement de données doit se terminer avant que l’appel suivant au modèle ne puisse utiliser le résultat. Les cœurs plus rapides font progresser chaque boucle plus rapidement.

Vera combine des cœurs haute performance avec jusqu’à 1,2 To/s de bande passante mémoire LPDDR5X à moins de 40 watts, ainsi qu’une puce de calcul monolithique conçue pour maintenir les cœurs actifs constamment alimentés et garantir des transferts de données prévisibles grâce à une bande passante inter-cœurs de 3,4 To/s, soit trois fois supérieure à celle de tout autre CPU de data center. Cela permet d’exploiter les 88 cœurs avec les performances mémoire complètes du CPU, sans créer de goulots d’étranglement susceptibles de ralentir chaque cœur.

Le résultat : des boucles agentiques plus rapides. Avec des charges de travail CPU intensives représentatives de l’exécution agentique, Vera offre des performances par cœur 1,8 fois supérieures à celles des processeurs x86.

Ces gains se cumulent à travers les appels d’outils, les exécutions de code, les étapes de traitement des données et les passes de vérification, ce qui permet aux usines d’IA d’effectuer davantage de travail d’agents avec les GPU qu’elles utilisent déjà.

Perplexity a testé Vera sur les tâches agentiques exécutées chaque jour. En exécutant un workflow de codage réel — clonage d’un dépôt et exécution de sa suite de tests dans des sandboxes — Vera a terminé la tâche environ 1,5 fois plus rapidement que x86 et a lancé des sandboxes simultanées jusqu’à 1,9 fois plus rapidement. Perplexity envisage désormais de déployer Vera dans le cadre de son prochain système de production.

Les agents dépendent également des données. Ils interrogent, récupèrent, filtrent et déplacent les informations en permanence, et Vera exécute plus rapidement les charges de travail de données côté CPU. Les partenaires ont mesuré des performances jusqu’à trois fois supérieures pour les analyses SQL à grande échelle avec Starburst, ainsi qu’une latence jusqu’à six fois plus faible pour le streaming de données en temps réel avec Redpanda, les deux solutions étant comparées aux principaux CPU de serveurs x86.

Le travail des agents ne se limite pas à une seule charge de travail. Un agent exécute des outils et des environnements sandbox, traite des données, répond aux demandes et entraîne le modèle suivant par apprentissage par renforcement — et tout cela repose sur les mêmes points forts.

Un seul Vera gère l’ensemble de la gamme, plutôt que de nécessiter un processeur différent pour chaque type de tâche. Et comme Vera est le même CPU que celui qui héberge les GPU dans NVIDIA Vera Rubin et alimente le processeur de stockage NVIDIA BlueField-4 STX, toute l’usine d’IA repose sur une seule architecture et une seule chaîne d’outils.

Et NVIDIA ne s’arrête pas là. Le processeur NVIDIA Rosa de nouvelle génération, doté du cœur Rigel, poursuivra la feuille de route de l’entreprise en matière de processeurs pour l’ère de l’IA agentique. Rigel est le cœur CPU Arm v9.2 de nouvelle génération de NVIDIA, qui fournit des performances par cœur plus élevées qu’Olympus tout en conservant la même empreinte silicium. Les principales améliorations incluent un meilleur acheminement des instructions, un cache L2 plus grand et une gestion de la mémoire plus efficace.

Conçu pour la vitesse des agents

À l’ère de l’IA agentique, il y aura des milliards d’agents, et chacun d’entre eux se tournera vers un CPU pour agir, contrôler, récupérer, exécuter et vérifier. Sur ce nouveau marché, le travail accompli par les agents constitue le produit. Des boucles d’agent plus rapides permettent à chaque GPU de consacrer davantage de temps à des tâches génératrices de revenus et moins de temps à attendre.

NVIDIA Vera est le CPU conçu pour cet avenir.

En savoir plus sur le CPU NVIDIA Vera.