NVIDIA accélère DiffusionGemma de Google DeepMind pour l’IA locale

Le nouveau modèle ouvert DiffusionGemma, qui génère du texte en parallèle et non jeton par jeton, a été optimisé pour une exécution sur la plateforme NVIDIA RTX PRO, les systèmes NVIDIA DGX Spark et les GPU GeForce RTX.
by

Aujourd’hui, Google DeepMind a lancé DiffusionGemma — un modèle ouvert expérimental conçu pour une génération de texte exceptionnellement rapide. NVIDIA a optimisé DiffusionGemma pour une exécution encore plus rapide sur les GPU NVIDIA GeForce RTX, la plateforme NVIDIA RTX PRO et les systèmes NVIDIA DGX Spark, des PC locaux jusqu’au Cloud.

Plutôt que de générer du texte un mot à la fois, DiffusionGemma génère plusieurs mots en parallèle pour fournir des blocs de texte entiers, ouvrant ainsi une nouvelle frontière à faible latence pour le type de charges de travail mono-utilisateur que les développeurs, les chercheurs et les passionnés d’IA exécutent chaque jour.

Les fonctionnalités du nouveau modèle incluent :

  • Génération parallèle : DiffusionGemma débruite jusqu’à 256 jetons par étape au lieu d’en prédire un à la fois.
  • Basé sur Gemma 4 : DiffusionGemma est basé sur Gemma 4, un modèle de mélange d’experts de 26 milliards de paramètres qui n’active que 3,8 milliards de paramètres par étape, associant une tête de diffusion à l’architecture Gemma 4 de Google.
  • Performances jusqu’à 4 fois plus rapides : Cette amélioration permet une génération de texte rapide, là où la génération pour un utilisateur unique stagne généralement — sur du matériel local.
  • Ouvert et local : DiffusionGemma est un modèle à poids ouverts sous une licence permissive Apache 2.0 et s’exécute entièrement sur RTX et DGX Spark — sans cloud, ni coût par jeton — avec une prise en charge immédiate dans Hugging Face Transformers, vLLM et Unsloth.

Une manière différente de générer du texte

La plupart des grands modèles de langage (LLM) largement utilisés de nos jours sont autorégressifs, ce qui signifie qu’ils génèrent du texte un jeton à la fois, chaque nouveau mot étant basé sur le précédent. C’est ce processus séquentiel qui peut donner l’impression que l’IA interactive fournit ses résultats de sortie progressivement et non immédiatement, comme si elle saisissait du texte.

DiffusionGemma prend une voie différente. Basé sur l’architecture de mélange d’experts Gemma 4 26B, il génère du texte de la même manière que les modèles de diffusion génèrent des images : en partant du bruit et en affinant un bloc de texte entier à la fois. Chaque étape permet de débruiter jusqu’à 256 jetons en parallèle plutôt que d’émettre un jeton unique et d’attendre de calculer le suivant.

Le résultat est un modèle qui pense par blocs plutôt que de manière séquentielle. Pour les travaux sensibles à la latence qui mobilisent un seul utilisateur, tels que les chats interactifs, les boucles agentiques ou les assistants embarqués qui planifient et agissent, ce parallélisme se traduit par des réponses suffisamment rapides pour suivre le rythme de la pensée et de l’itération des développeurs.

DiffusionGemma fournit des performances de haut vol sur les GPU NVIDIA

La génération d’un jeton à la fois est un problème fondamentalement lié à la mémoire : un LLM traditionnel passe la majeure partie de son temps à attendre la bande passante mémoire plutôt qu’à effectuer des calculs, ce qui laisse une grande partie de la puissance de calcul inutilisée.

La diffusion inverse l’équation. L’extraction d’un bloc complet de 256 jetons via le transformateur en parallèle constitue une charge de travail liée au calcul, c’est-à-dire la mission première des GPU de NVIDIA, qui excellent dans le calcul accéléré. Les Tensor Cores NVIDIA accélèrent les opérations mathématiques parallèles denses, et la pile logicielle CUDA permet au modèle de fonctionner efficacement dès le premier jour sans nécessiter de réglage particulier. En bref, la conception du modèle tire directement parti despoints forts du GPU.

Les chiffres le prouvent. DiffusionGemma fournit 1 000 jetons par seconde sur un seul GPU NVIDIA H100 Tensor Core, 150 jetons par seconde sur NVIDIA DGX Spark et jusqu’à 2 000 jetons par seconde sur NVIDIA DGX Station, soit des performances environ 4 fois plus rapides qu’un modèle autorégressif équivalent exécuté avec le même régime mono-utilisateur.

Cet avantage s’applique à l’ensemble de la gamme NVIDIA, et notamment:

  • En local sur le supercalculateur personnel d’IA de bureau NVIDIA DGX Spark — alimenté par la superpuce NVIDIA GB10 Grace Blackwell disposant de 128 Go de mémoire unifiée — avec la pile logicielle d’IA NVIDIA préinstallée, prête pour le prototypage, le réglage fin et les workflows d’agents entièrement locaux.
  • Sur les stations de travail NVIDIA RTX PRO 6000, ce qui offre aux développeurs, aux chercheurs et aux professionnels de l’IA la marge de manœuvre nécessaire pour exécuter des boucles locales de génération à faible latence et des boucles agentiques dans le cadre d’un workflow professionnel.
  • Sur DGX Station, garantissant une inférence locale à haute vitesse de premier plan avec jusqu’à 2 000 jetons par seconde pour la génération de texte à faible latence et des boucles agentiques disposant de 748 Go de mémoire cohérente.
  • Sur les GPU GeForce RTX, avec la prise en charge à venir de llama.cpp.

Démarrez localement

Le moyen le plus rapide de commencer à tester et à prototyper le modèle consiste à utiliser Hugging Face Transformers, qui permet d’exécuter DiffusionGemma sur un GPU GeForce RTX 5090 ou sur DGX Spark de manière immédiate. Pour une inférence à haut débit, vLLM fournit une assistance de service dès le premier jour.

Pour adapter le modèle à une tâche ou à un domaine spécifique, le fine-tuning est disponible via Unsloth et le framework NVIDIA NeMo, avec des playbooks DGX Spark prêts à l’emploi pour mettre en place rapidement un environnement local. Consultez les playbooks vLLM pour DGX Spark , RTX PRO et DGX Station.

Essayez Diffusion Gemma sur Hugging Face ou testez-le gratuitement en utilisant les interfaces de programmation d’applications hébergées par NVIDIA sur build.nvidia.com.

Apprenez-en plus sur l’architecture et le déploiement local en lisant l’article technique de NVIDIA et l’annonce de Google DeepMind.

#ICYMI : les dernières actualités de RTX AI Garage

🎬 Les chercheurs de NVIDIA ont publié SANA-WM, un modèle de monde open-source qui transforme une image unique et une trajectoire de caméra en une vidéo 720p d’une minute avec un contrôle précis à 6 degrés de liberté. Avec seulement 2,6 milliards de paramètres, sa version distillée génère un clip complet de 60 secondes en 34 secondes sur un seul GPU NVIDIA GeForce RTX 5090 utilisant le format NVFP4, ce qui permet de fournir un débit jusqu’à 36 fois supérieur à celui des modèles ouverts comparables lorsqu’ils sont exécutés sur un seul GPU. Lisez l’article.

🛠️ La création d’agents Windows dispose désormais d’un ensemble d’outils complet NVIDIA et Microsoft ont déployé un sandboxing d’agents clé en main sur Windows natif — Microsoft eXecution Containers plus le runtime NVIDIA OpenShell — ainsi qu’une inférence agentique jusqu’à 2 fois plus rapide et une prise en charge native de Windows pour Hermes Agent.

🤖DGX Spark passe du déballage à un agent opérationnel en quelques minutes — Une installation simplifiée de NVIDIA NemoClaw permet aux développeurs d’obtenir rapidement un agent local fonctionnel, avec Qwen3.6-35B s’exécutant jusqu’à 2,6 fois plus vite sur vLLM. Le nouvel assistant de cluster de NVIDIA Sync relie jusqu’à quatre unités DGX Spark dans un pool de mémoire de 512 Go, ce qui est suffisant pour des modèles de 400 milliards de paramètres environ.

Suivez l’actualité de RTX Spark sur Facebook, Instagram, TikTok et X — et assurez-vous de ne manquer aucune information en vous abonnant à la newsletter RTX Spark.

Consultez l’avis relatif aux informations sur les produits logiciels.