Nvidia : des grands modèles formés "une seule fois" aux Agents à "amélioration post-entraînement", les besoins en puissance de calcul évoluent
Nvidia redéfinit la logique de monétisation de la puissance de calcul ! Sa nouvelle plateforme, Vera Rubin, introduit pour la première fois l'indicateur « intelligence par dollar », misant sur l'intelligence artificielle des agents. Après la formation des modèles, la demande évolue vers une utilisation continue et ininterrompue ; la consommation de GPU n'est plus que d’un quart par rapport à la génération précédente. Les géants se mettent déjà en file pour migrer, ouvrant une nouvelle vague d’expansion dans le grand marché de la puissance de calcul !
Nvidia étend la proposition de valeur centrale de sa prochaine plateforme Vera Rubin de l'optimisation du coût de l'inférence à l'efficacité de l'entraînement des modèles, misant sur la nouvelle métrique "intelligence par dollar" pour parier que dans l’ère de l’Agentic AI, l’entraînement continu des modèles deviendra le principal besoin de puissance de calcul.
Nvidia explique dans son blog officiel qu’avec l’essor de l’Agentic AI, l’entraînement postérieur du modèle est passé d’une étape de finalisation ponctuelle à une charge de travail centrale et cyclique. Contrairement aux modèles génératifs traditionnels, les modèles d’agents doivent planifier, appeler des outils et corriger leurs propres erreurs en cours d’exécution, leur environnement pouvant changer chaque semaine, ce qui entraîne une demande de calcul post-entraînement en constante augmentation. Nvidia indique que la plateforme Vera Rubin a été conçue pour répondre à cette charge de travail, permettant de former les plus grands modèles avec seulement un quart du nombre de GPU par rapport à la génération précédente Blackwell.
Ce changement impacte directement la logique de vente de la puissance de calcul de Nvidia : la boucle de post-entraînement ne s’arrête jamais, ce qui signifie que la demande des clients pour des clusters GPU passe d’une logique de projet à une logique permanente, élargissant la taille du marché potentiel. Des entreprises telles que Prime Intellect, Perplexity et Together AI, qui exécutent déjà des charges de post-entraînement sur la plateforme Nvidia, ont toutes déclaré leur intention de migrer ou d’étendre leurs opérations vers la plateforme Vera Rubin.
Le post-entraînement devient le moteur central de calcul à l’ère de l’Agentic AI
Nvidia développe dans son blog la place stratégique du post-entraînement. La phase de pré-entraînement confère au modèle sa fluidité linguistique, mais la véritable "intelligence" — incluant la programmation, la planification de tâches complexes, l’utilisation d’outils de recherche et la récupération après une erreur — se forme lors du post-entraînement.

Le post-entraînement utilise la technique de l’apprentissage par renforcement (RL) : le modèle génère des essais pour une tâche donnée (propagation avant), ces essais sont ensuite évalués et les poids du modèle sont mis à jour (rétropropagation). Après des millions d’itérations, les capacités du modèle s’améliorent progressivement. Nvidia souligne que ce processus consomme une puissance de calcul très élevée, nécessitant la génération parallèle de rollout dans des milliers d’environnements, tout en maintenant les accélérateurs en charge maximale.
Nvidia place "l’intelligence par dollar" comme une métrique supérieure au "coût par token" : la première mesure l’efficacité opérationnelle de l’usine d’inférence, la seconde vérifie si l’investissement pour construire et maintenir un modèle apte au déploiement est rentable. Les deux s’imbriquent — réduire le coût par token réduit également le coût de construction de l’intelligence du modèle, tandis qu’un modèle plus intelligent augmente la valeur de service de chaque token.
Nemotron Ultra fournit une référence vérifiable pour le post-entraînement
Pour étayer cette proposition, Nvidia dévoile les détails du post-entraînement de son modèle open source Nemotron 3 Ultra. Ce modèle dispose de 550 milliards de paramètres et adopte une architecture de type mixture of experts (MoE), avec tout le processus de post-entraînement réalisé dans le cadre NeMo RL.
Dans le test de référence réel SWE-bench Verified, Nemotron 3 Ultra obtient un score de 71,7%, soit la capacité de générer des solutions de correction efficaces pour environ sept sur dix défauts logiciels réels issus de projets open source et validées par les tests internes du projet. Nvidia indique que ce résultat peut être vérifié et que le processus de post-entraînement est entièrement ouvert.

Nvidia indique également que la plateforme Blackwell, en réduisant le coût par exécution, rend possible économiquement le post-entraînement haute fréquence nécessaire à l’ère de l’Agentic AI, tandis que Vera Rubin poussera encore cette trajectoire — permettant plus de rollout, plus d’environnements parallèles et des cycles de post-entraînement ininterrompus.
Les principaux clients valident les capacités de la plateforme, les plans de migration émergent
Plusieurs entreprises utilisant déjà des charges de post-entraînement sur la plateforme Nvidia ont détaillé leurs solutions techniques et exprimé leur intention de migrer vers Vera Rubin.
Prime Intellect poursuit le post-entraînement des modèles open source de pointe sur Blackwell et utilise NVIDIA Dynamo pour l’orchestration de l’inférence. La société a intégré l’infrastructure sandbox avec le CPU NVIDIA Vera, et lors des tests comparatifs avec l’architecture x86, le CPU Vera a présenté un débit moyen supérieur de 30% sur des charges réelles de sandbox RL. Prime Intellect prévoit d’étendre l’échelle des environnements de RL grâce à Vera Rubin et d’accélérer les cycles d’itération de l’entraînement à l’inférence.
La pile de post-entraînement RL de Perplexity fonctionne de façon asynchrone sur des centaines de GPU Nvidia, avec un moteur de transfert de poids basé sur RDMA permettant de synchroniser un modèle de mille milliards de paramètres entre les nœuds d’entraînement et d’inférence en deux secondes. Le modèle Qwen3 235B, entraîné postérieurement, est ensuite déployé sur le système NVIDIA GB200 NVL72.
Together AI propose des capacités de post-entraînement sous forme de service, couvrant le fine-tuning supervisé, l’apprentissage par renforcement et l’optimisation directe des préférences, distribuées via API et SDK. Actuellement hébergé sur la plateforme Nvidia, Together AI indique chercher à intégrer la plateforme Vera Rubin.
Avertissement : le contenu de cet article reflète uniquement le point de vue de l'auteur et ne représente en aucun cas la plateforme. Cet article n'est pas destiné à servir de référence pour prendre des décisions d'investissement.
Vous pourriez également aimer

Trump déclare que Powell devrait démissionner de son poste de gouverneur de la Réserve fédérale.
Le président américain Trump a publié un message sur les réseaux sociaux, exigeant que Powell démissionne immédiatement de son poste de membre du conseil des gouverneurs de la Réserve fédérale, et a menacé que si Powell refuse de démissionner, le gouvernement américain engagerait des poursuites pour corruption ou faute professionnelle. Cette déclaration fait suite à la publication d’un rapport par l’Inspecteur général interne de la Réserve fédérale qui, bien qu’il n’ait révélé aucune infraction pénale, a mis en lumière plusieurs erreurs de gestion ayant conduit à un dépassement important des coûts du projet de rénovation du siège.
La demande de mémoire pour l’IA continue d’exploser ; Micron (MU.US) dépasse les attentes avec ses résultats du quatrième trimestre ; le chiffre d’affaires trimestriel de son activité principale dans les centres de données a été multiplié par plus de dix sur un an.
Le géant des puces de stockage Micron Technology a publié mercredi après la clôture des marchés ses résultats du quatrième trimestre de l'exercice 2026, avec un chiffre d'affaires et un bénéfice dépassant les attentes de Wall Street, et a fourni des prévisions pour le prochain trimestre supérieures aux attentes du marché.
La Réserve fédérale adopte la réforme du test de résistance par un vote de 6 contre 1 : la volatilité des exigences de capital est réduite de moitié, le seul vote contre avertit d'une perte de résilience.
La Réserve fédérale a officiellement approuvé deux règles finales visant à accroître la transparence et à réduire d'environ 50 % la volatilité des exigences en matière de capital. Les nouvelles règles inviteront le public à commenter les scénarios des tests de résistance et utiliseront une moyenne des résultats des deux années consécutives de tests pour calculer le coussin de capital, ce mécanisme de moyenne entrant en vigueur en 2028. Cette réforme est le résultat de plusieurs années de négociations dans le secteur bancaire, et les groupes industriels s’en félicitent. Cependant, des critiques comme le gouverneur Barr avertissent que la réforme affaiblira l'effet contraignant des tests de résistance et réduira la résilience globale du système bancaire.

