Bitget App
Trade smarter
Acquista CryptoMercatiTradingPerpsEarnAIPlazaAltro
Puntando al mercato dell'inferenza AI a bassa latenza, Nvidia (NVDA.US) Groq 3 LPX avvia la produzione di massa completa; i primi sistemi saranno implementati presso NEBIUS (NBIS.US).

Puntando al mercato dell'inferenza AI a bassa latenza, Nvidia (NVDA.US) Groq 3 LPX avvia la produzione di massa completa; i primi sistemi saranno implementati presso NEBIUS (NBIS.US).

智通财经智通财经2026/08/25 01:06
Mostra l'originale
Per:智通财经

Lunedì Nvidia ha annunciato che il sistema Groq 3 LPX a livello rack è entrato nella fase di piena produzione, segnando così il passaggio alla commercializzazione della tecnologia di inferenza AI a bassa latenza, dopo che l'anno scorso l'azienda aveva acquisito asset correlati a Groq per circa 20 miliardi di dollari.

Secondo quanto riportato da Finanza Intelligente, Nvidia (NVDA.US) ha annunciato lunedì che il sistema rack-level Groq 3 LPX è entrato nella fase di piena produzione, segnando l’inizio della commercializzazione della tecnologia di inferenza AI a bassa latenza dopo che l’azienda ha acquisito asset correlati a Groq per circa 20 miliardi di dollari lo scorso anno. I primi sistemi saranno distribuiti presso il provider di servizi cloud AI NEBIUS (NBIS.US) e si prevede che saranno operativi entro la fine dell’anno.

Dion Harris, Senior Director di Nvidia, ha dichiarato ai media che Groq 3 LPX sarà implementato nei data center di Nebius insieme alle CPU Vera e alle GPU Rubin di Nvidia.

La rapida transizione alla produzione di Groq evidenzia come, con il passaggio delle applicazioni AI dall’addestramento del modello all’implementazione pratica, l’inferenza AI a bassa latenza stia diventando un nuovo mercato chiave su cui Nvidia punta. Questo è particolarmente vero per applicazioni quali agenti AI e programmazione AI, dove è richiesto che i modelli generino contenuti in modo continuativo e rapido, riducendo i tempi di attesa per gli utenti.

Nel dicembre scorso, Nvidia ha speso circa 20 miliardi di dollari per acquisire asset correlati alla startup di chip AI Groq, realizzando così la più grande acquisizione della storia dell’azienda.

Una delle caratteristiche principali dell’architettura dei chip Groq è l’integrazione di 500MB di SRAM ad alta velocità direttamente nel chip, al fine di ridurre i colli di bottiglia dovuti all’accesso alla memoria tradizionale e aumentare così la reattività nei processi di inferenza dei modelli AI.

A differenza delle principali GPU di Nvidia, prodotte da TSMC (TSM.US), i chip Groq sono prodotti da Samsung.

Attualmente, Nvidia integra 256 chip Groq 3 in un singolo rack LPX. Secondo i benchmark condotti da Artificial Analysis e citati da Nvidia, il sistema Groq 3 LPX può generare circa 3400 token al secondo.

Per quanto riguarda l’AI generativa, un token può essere considerato l’unità base con cui il modello elabora e genera testo. Una velocità di generazione di token più elevata al secondo si traduce in risposte più rapide dell’AI, il che è particolarmente importante per applicazioni come programmazione AI ed agenti in tempo reale, dove la latenza è un fattore critico.

Harris ha osservato che, per le aziende cloud che offrono servizi di inferenza AI, una latenza più bassa consente di offrire servizi premium a prezzo maggiore a clienti che richiedono velocità di risposta elevate.

Tuttavia, i chip Groq non sono progettati per sostituire le tradizionali GPU di Nvidia.

Le GPU continuano a rappresentare il cuore delle infrastrutture di calcolo AI attuali, in quanto non solo addestrano i modelli, ma possono eseguire anche operazioni di inferenza, offrendo maggiore versatilità e adattandosi a modelli e architetture differenti.

Chip come Groq, specificamente progettati per la bassa latenza, si concentrano su determinati aspetti dell’inferenza AI, in particolare nella fase di “decodifica” durante la generazione del contenuto da parte del modello.

Harris ha sottolineato: “Non si tratta di sostituire la GPU, ma di selezionare il processore più adatto in termini di prezzo e prestazioni per ciascuna parte del carico di lavoro.”

Questo significa che Nvidia sta cercando di creare un’architettura di calcolo AI sempre più specializzata: la CPU Vera e la GPU Rubin continueranno a sostenere i carichi di calcolo AI più ampi, mentre i chip Groq saranno ottimizzati per i carichi di lavoro di inferenza più sensibili alla latenza.

Con il graduale passaggio dell’industria AI dall’addestramento su larga scala al rapido aumento della domanda di inferenza, la competizione nel mercato delle inferenze a bassa latenza si sta intensificando.

All’inizio di quest’anno, AMD (AMD.US) ha annunciato che integrerà i propri sistemi rack-level AI con i chip Cerebras (CBRS.US), puntando anch’essa sull’inferenza AI a bassa latenza.

L’importanza di questo settore sta crescendo ulteriormente con la diffusione di applicazioni come la programmazione AI. Secondo quanto riportato, la nuova modalità Ultrafast di OpenAI promette di raggiungere 750 token al secondo, con il supporto di calcolo fornito da Cerebras.

In confronto, i benchmark citati da Nvidia mostrano che Groq 3 LPX può raggiungere 3400 token al secondo. Tuttavia, le condizioni di test e gli scenari d’uso possono variare, quindi questi numeri non sono direttamente confrontabili come prestazioni assolute.

Nel frattempo, Nvidia sta accelerando la consegna dei sistemi Vera Rubin, che sono entrati in produzione all’inizio di quest’anno.

Il CEO di Nvidia, Jensen Huang, ha previsto a marzo, durante la presentazione di Vera Rubin e Groq 3 LPX, che le vendite cumulative dai chip Blackwell ai nuovi sistemi Vera Rubin potrebbero raggiungere 1 trilione di dollari entro il 2027.

Huang ha anche rivelato che, negli spazi data center destinati specificamente alla programmazione AI, intende allocare circa un quarto alle soluzioni Groq, mentre il resto sarà destinato esclusivamente ai sistemi Vera Rubin.

Questo rapporto di allocazione dimostra ulteriormente quanto Nvidia dia importanza al mercato dell’inferenza a bassa latenza. Con lo sviluppo rapido di agenti AI, della programmazione AI e delle applicazioni generative in tempo reale, la velocità di inferenza sta diventando un indicatore chiave di competitività per le imprese cloud e gli sviluppatori di AI.

L’entrata in piena produzione di Groq 3 LPX segna anche la transizione di Nvidia da fornitore di chip AI incentrati sulle GPU a leader nelle architetture di calcolo specializzate in base ai diversi carichi di lavoro AI.

Il mercato seguirà ora da vicino le prossime performance finanziarie di Nvidia. Mercoledì di questa settimana saranno pubblicati i risultati finanziari dell’azienda: oltre alle richieste di Blackwell e Vera Rubin, l’andamento dell’attività di inferenza AI e l’evoluzione commerciale di Groq potrebbero rappresentare i nuovi punti di maggiore interesse per gli investitori.

0
0

Esclusione di responsabilità: il contenuto di questo articolo riflette esclusivamente l’opinione dell’autore e non rappresenta in alcun modo la piattaforma. Questo articolo non deve essere utilizzato come riferimento per prendere decisioni di investimento.

PoolX: Blocca per guadagnare
Almeno il 12% di APR. Sempre disponibile, ottieni sempre un airdrop.
Blocca ora!

Ti potrebbe interessare anche

La batteria si alleggerisce del 40% e si libera dai vincoli del germanio! La batteria ultraleggera di Rocket Lab (RKLB.US) apre la strada al mercato in crescita dell'AI nello spazio

"IMM Apex, pur offrendo prestazioni eccezionali, ha anche affrontato le sfide reali dell'aumento dei costi dei materiali e delle restrizioni della catena di approvvigionamento," ha dichiarato Brad Clevenger, presidente di Rocket Lab USA.

智通财经2026/09/09 12:42
La batteria si alleggerisce del 40% e si libera dai vincoli del germanio! La batteria ultraleggera di Rocket Lab (RKLB.US) apre la strada al mercato in crescita dell'AI nello spazio

Pre-market azionario USA | I futures dei tre principali indici azionari scendono tutti, Brent supera i 100 dollari, Besant annuncerà a breve la scala del riacquisto dei titoli del Tesoro USA, evento di presentazione Apple in arrivo

Mercoledì 9 settembre, prima dell'apertura del mercato azionario statunitense, tutti e tre i principali future degli indici azionari statunitensi sono scesi.

智通财经2026/09/09 12:21
Pre-market azionario USA | I futures dei tre principali indici azionari scendono tutti, Brent supera i 100 dollari, Besant annuncerà a breve la scala del riacquisto dei titoli del Tesoro USA, evento di presentazione Apple in arrivo

La fine dell’AI non riguarda solo l’energia elettrica, ma anche le bollette! Con i data center che diventano il fulcro delle elezioni americane, gli investimenti nelle infrastrutture AI affrontano una “prova di pressione elettorale”.

Nel 2026, la spesa per i data center, pilastro dell'industria dell’intelligenza artificiale, ha raggiunto un livello record. Tuttavia, insieme all’ondata di costruzione delle infrastrutture, quest’anno sono aumentate fortemente le voci di opposizione ai data center: questa questione, inizialmente locale, si è rapidamente trasformata in un tema chiave per le elezioni di metà mandato di novembre.

智通财经2026/09/09 11:46
La fine dell’AI non riguarda solo l’energia elettrica, ma anche le bollette! Con i data center che diventano il fulcro delle elezioni americane, gli investimenti nelle infrastrutture AI affrontano una “prova di pressione elettorale”.

Dall’AI all’oro e ai titoli di Stato USA: quasi tutto sta raggiungendo nuovi massimi, il mercato accoglie l’“Everything High”

La spesa in conto capitale per l'IA e le aspettative di utili aziendali continuano a essere riviste al rialzo, mentre anche energia, oro, rendimenti dei titoli di Stato USA e posizioni di mercato stanno aumentando contemporaneamente. In apparenza, ciò indica un generale riscaldamento della crescita e della propensione al rischio; tuttavia, quando inflazione, tassi di interesse e operazioni affollate si trovano tutti su livelli elevati, il margine di tolleranza del mercato nei confronti della sostenibilità del boom dell'IA si sta restringendo.

华尔街见闻2026/09/09 11:16