Morgan Stanley: La carenza di memoria per l’AI durerà per anni; tre percorsi principali di soluzione; opportunità strutturali per lo storage e la potenza di calcolo eterogenea
Morgan Stanley ha pubblicato un rapporto sul settore dei semiconduttori, sottolineando che la carenza di memoria DRAM persisterà durante tutto il ciclo attuale dell’industria AI, mentre l’espansione della capacità di calcolo AI non aspetterà la costruzione e l’entrata in funzione di nuove fabbriche di wafer.
Secondo quanto riportato da Zhitong Caijing APP, Morgan Stanley ha pubblicato un report sul settore dei semiconduttori in cui evidenzia che la carenza di memoria DRAM persisterà durante tutto questo ciclo industriale dell'AI, mentre l’espansione della potenza di calcolo dell’AI non aspetterà la costruzione e la produzione di nuove fabbriche di wafer. Il settore sta aggirando il collo di bottiglia della memoria attraverso tre principali percorsi tecnologici: riduzione delle specifiche hardware, disaccoppiamento dell’architettura di inferenza e la poolizzazione della memoria tramite CXL. In un contesto di offerta limitata, la costruzione delle capacità di calcolo continua ad avanzare. L’istituto rimane ottimista su leader nello storage come Micron (MU.US) e SanDisk (SNDK.US), ed è positivo sulle opportunità incrementali offerte dai settori dell’interconnessione CXL e dell’inferenza eterogenea, raccomandando Astera Labs (ALAB.US), Marvell (MRVL.US), Cerebras (CBRS.US) e Nvidia (NVDA.US).
Morgan Stanley sottolinea che la carenza attuale di memoria AI non è una perturbazione temporanea, ma uno squilibrio strutturale in cui la crescita delle prestazioni di calcolo supera di gran lunga la velocità di crescita dell’offerta di memoria. La scala dei modelli avanzati raddoppia ogni sei mesi, le finestre di contesto dei modelli principali crescono annualmente del 5-6 volte e, con la crescente domanda di inferenza concorrente, la richiesta di capacità e banda di memoria continua a esplodere. Tuttavia, il ciclo di costruzione di una fabbrica di wafer DRAM può durare anni, la flessibilità dell’offerta è estremamente bassa, e la situazione di carenza durerà diversi anni. Anche il CEO di Nvidia, Jensen Huang, ha dichiarato pubblicamente che l’industria deve cambiare approccio e affrontare il vincolo della memoria tramite innovazioni architetturali, invece di attendere semplicemente un’espansione della capacità produttiva.
Per affrontare le tensioni nell’offerta di HBM e memoria principale, il modo più diretto per il settore è la riduzione selettiva delle specifiche di memoria per singolo dispositivo ("De-speccing"). Prendendo come esempio l’architettura Rubin di Nvidia, la capacità LPDDR5 per singolo rack è stata ridotta da 54 TB pianificati a 28 TB, mentre la capacità HBM per singolo GPU è stata abbassata da 288 GB a 192 GB, assicurando così la quantità di unità consegnate riducendo l’altezza degli stack di memoria. Morgan Stanley sottolinea che la riduzione delle specifiche non elimina il collo di bottiglia della memoria, bensì trasferisce la pressione tra i diversi livelli di memoria: il taglio della memoria locale ad alta velocità porta i dati non ad alta frequenza come i KV cache a spostarsi verso lo storage NAND e aumenta lo scambio di dati cross-GPU, stimolando la domanda di banda di rete di interconnessione; in sostanza, si compensa la scarsità di memoria ad alta banda con risorse di rete più rapide e di archiviazione a costi inferiori.
Il secondo percorso per risolvere il problema è il disaccoppiamento dell’architettura di inferenza (Disaggregation). L’inferenza AI include due fasi molto diverse: il Prefill, che consuma principalmente potenza di calcolo, e il Decode, che dipende fortemente dalla banda di memoria. L’architettura tradizionale usa lo stesso acceleratore per entrambe le attività, portando a una bassa efficienza nell’uso delle risorse. Attualmente il settore sta accelerando verso un’inferenza eterogenea, separando le due fasi su hardware differenti: il Prefill intensivo di calcolo affidato a GPU generiche, mentre il Decode, che richiede grande larghezza di banda di memoria, viene gestito da chip acceleratori specializzati dotati di ampie SRAM on-chip.
Esempi tipici includono il motore a livello di wafer di Cerebras e l’architettura Groq LPU acquisita da Nvidia, entrambe in grado di offrire durante la fase di Decode un’efficienza di banda di memoria ben superiore a quella delle GPU tradizionali. Morgan Stanley ritiene che l’inferenza eterogenea diventerà una delle principali direzioni evolutive delle infrastrutture AI e che i fornitori di potenza di calcolo specializzati nella fase di Decode acquisiranno un chiaro mercato incrementale.
Il terzo percorso consiste nella ricostruzione del sistema di memoria tramite la tecnologia CXL. CXL (Compute Express Link) permette di espandere, condividere e poolare la memoria tramite interconnessioni ad alta velocità, consentendo alla memoria di non essere più vincolata a un singolo processore e diventando così un percorso tecnologico chiave per superare il limite della capacità di memoria. Secondo le stime di Morgan Stanley, la domanda di AI porterà il mercato di CXL e dei relativi chip di memoria aggiuntiva a raggiungere circa 6 miliardi di dollari entro il 2030, ben oltre la dimensione del tradizionale mercato di espansione di memoria per CPU. Il suo valore principale risiede nella costruzione di un’architettura di memoria gerarchica: i dati a più alta frequenza restano in HBM, quelli di frequenza intermedia nel pool di memoria CXL e i dati a bassa frequenza in NAND, abbinando così il costo all’intensità di accesso ai dati.
Per quanto riguarda le linee guida di investimento, Morgan Stanley ribadisce tre direzioni principali: la prima è continuare a sovrappesare Micron e SanDisk, la riduzione delle specifiche è causata dalla carenza d’offerta e non dal calo della domanda, la domanda di memoria AI è in aumento nel lungo termine e il gap di offerta continuerà a essere assorbito dalla capacità produttiva; la seconda è investire nei leader dell’interconnessione CXL e scale-up, ovvero Astera Labs e Marvell; la terza è monitorare i beneficiari dell’inferenza eterogenea come Cerebras e Nvidia, che sta perfezionando il proprio posizionamento nel settore attraverso l’acquisizione di Groq.
Avvertenze sui rischi: la crescita della domanda di potenza AI inferiore alle attese; il progresso della tecnologia CXL più lento del previsto; l’espansione della capacità di memoria superiore alle stime.
Esclusione di responsabilità: il contenuto di questo articolo riflette esclusivamente l’opinione dell’autore e non rappresenta in alcun modo la piattaforma. Questo articolo non deve essere utilizzato come riferimento per prendere decisioni di investimento.
Ti potrebbe interessare anche
Dopo il rilascio delle riserve da parte del G7, Trump interviene nuovamente per abbassare il prezzo del petrolio prima delle elezioni: si presume che intenda allentare le restrizioni sull'uso del "diesel rosso" esente da tasse
Secondo quanto riportato, l'amministrazione Trump prevede di annunciare il relativo piano già lunedì di questa settimana, con la possibilità di ampliare l'uso del diesel rosso anche ai veicoli su strada. Venerdì scorso, il G7 ha annunciato il rilascio di 100 milioni di barili di riserve petrolifere d'emergenza e l'immissione di grandi quantità di diesel nei venti giorni precedenti. Successivamente, Trump ha dichiarato che gli Stati Uniti non applicheranno più il divieto di esportazione del diesel; l'Europa dispone di grandi quantità di diesel e anche gli Stati Uniti aumenteranno l'offerta.
La vendita dei titoli di stato USA spinge i rendimenti ai massimi di decenni Citadel: la crescita economica e gli investimenti in AI intensificano la competizione per il capitale
Citadel Securities ritiene che la recente vendita dei titoli del debito pubblico statunitense e il raggiungimento dei rendimenti ai massimi da decenni non siano principalmente dovuti alla preoccupazione del mercato per un ulteriore peggioramento dell'inflazione, ma piuttosto alla continua robustezza della crescita economica americana, nonché agli investimenti in intelligenza artificiale (AI) e al deficit pubblico che hanno intensificato la competizione per il capitale.
L’incertezza fiscale e politica in Francia colpisce il settore finanziario! I tre principali indicatori di rischio di credito delle banche sono in aumento, mentre il costo dell’assicurazione contro il default sui titoli di stato sale sensibilmente
Con la crescente preoccupazione sullo stato delle finanze francesi e sulla situazione politica del paese che si diffonde nei mercati del credito, gli indicatori di rischio creditizio sulle obbligazioni delle principali banche francesi sono aumentati in modo significativo.
I titoli sovrani europei lanciano l'allarme, ma i mercati azionari rimangono solidi! Il differenziale tra Francia e Germania registra il più grande aumento settimanale degli ultimi 30 anni. Deutsche Bank avverte che la divergenza potrebbe non durare
Il mercato dei titoli di Stato sovrani europei ha registrato una pressione evidente la scorsa settimana, mentre il mercato azionario europeo e quello del credito aziendale sono rimasti relativamente calmi, creando una rara divergenza tra diverse classi di attività.
