Morgan Stanley: Kekurangan memori AI akan berlangsung selama beberapa tahun, tiga jalur utama untuk memecahkan masalah, peluang struktural bagi penyimpanan dan komputasi heterogen
Morgan Stanley merilis laporan penelitian industri semikonduktor yang menunjukkan bahwa kelangkaan memori DRAM akan berlangsung sepanjang siklus industri AI saat ini, dan ekspansi daya komputasi AI tidak akan menunggu pembangunan serta operasional pabrik wafer baru.
Aplikasi keuangan Zhihui Finance APP mengetahui bahwa Morgan Stanley telah merilis laporan riset industri semikonduktor yang menyatakan bahwa kekurangan memori DRAM akan berlangsung sepanjang siklus industri AI kali ini, dan ekspansi daya komputasi AI tidak akan menunggu hingga pabrik wafer baru dibangun dan berproduksi. Industri saat ini mengatasi kendala memori melalui tiga jalur teknologi utama: penurunan spesifikasi perangkat keras, desentralisasi arsitektur inferensi, dan pemrosesan pool memori CXL, sehingga pembangunan daya komputasi dapat terus berlanjut meskipun terdapat keterbatasan pasokan. Morgan Stanley tetap optimis terhadap pemimpin industri storage seperti Micron (MU.US) dan SanDisk (SNDK.US), serta melihat peluang pertumbuhan pada jalur CXL interkoneksi dan inferensi heterogen, merekomendasikan Astera Labs (ALAB.US), Marvell (MRVL.US), Cerebras (CBRS.US), dan Nvidia (NVDA.US).
Morgan Stanley menekankan bahwa kekurangan memori AI saat ini bukanlah gangguan jangka pendek, melainkan kontradiksi struktural di mana pertumbuhan kinerja daya komputasi jauh melebihi kecepatan pasokan memori. Skala model besar paling depan berlipat ganda setiap 6 bulan, jendela konteks model teratas tumbuh 5-6 kali lipat per tahun, dan permintaan inferensi paralel juga terus meningkat, sehingga kebutuhan kapasitas dan bandwidth memori terus melonjak. Sementara pembangunan pabrik wafer DRAM memakan waktu bertahun-tahun dan elastisitas pasokan sangat rendah, sehingga situasi kekurangan akan berlangsung selama bertahun-tahun. CEO Nvidia, Jensen Huang, juga secara terbuka menyatakan bahwa industri perlu mengubah cara berpikir dan berinovasi dalam arsitektur untuk menghadapi kendala memori, bukan sekadar menunggu ekspansi kapasitas produksi.
Menghadapi kekurangan pasokan HBM dan memori utama, cara paling langsung yang dilakukan industri adalah dengan sengaja menurunkan spesifikasi memori per perangkat (De-speccing). Misalnya pada arsitektur Nvidia Rubin, kapasitas LPDDR5 per server diturunkan dari rencana awal 54TB menjadi 28TB, sementara kapasitas HBM per GPU diturunkan dari 288GB menjadi 192GB, dengan menurunkan tingkat tumpukan memori untuk memastikan volume pengiriman mesin. Morgan Stanley menunjukkan bahwa penurunan spesifikasi bukan untuk menghilangkan bottleneck memori, melainkan memindahkan tekanan antar level memori: setelah mengurangi memori lokal berkecepatan tinggi, data non-high frequency seperti KV cache diturunkan ke penyimpanan NAND, sementara interaksi data antar GPU meningkat, yang memicu permintaan bandwidth jaringan interkoneksi. Pada dasarnya, hal ini menggantikan high bandwidth memory yang langka dengan sumber daya penyimpanan berbiaya lebih rendah dan jaringan interkoneksi yang lebih cepat.
Jalur kedua untuk mengatasi masalah ini adalah desentralisasi arsitektur inferensi (Disaggregation). Inferensi AI terdiri dari dua tahap yang sangat berbeda: Prefill yang lebih banyak menggunakan daya komputasi, dan Decode yang sangat bergantung pada bandwidth memori. Arsitektur tradisional menggunakan akselerator yang sama untuk kedua tugas, sehingga efisiensi pemanfaatan sumber daya menjadi rendah. Saat ini industri bergerak cepat menuju inferensi heterogen, yaitu memisahkan dua tahap ini ke perangkat keras yang berbeda: Prefill yang padat komputasi dikerjakan oleh GPU umum, sementara Decode yang sangat memerlukan bandwidth memori dikerjakan oleh akselerator khusus dengan SRAM on-chip berkapasitas besar.
Contoh tipikal termasuk engine wafer-scale dari Cerebras dan arsitektur Groq LPU yang diakuisisi Nvidia, yang keduanya dapat menyediakan efisiensi bandwidth memori jauh melebihi GPU tradisional pada tahap decode. Morgan Stanley percaya bahwa inferensi heterogen akan menjadi arah evolusi penting bagi infrastruktur AI, dan perusahaan akselerator spesialis decode akan mendapatkan pasar tambahan yang jelas.
Jalur ketiga ialah teknologi CXL merekonstruksi sistem memori. CXL (interkoneksi komputasi berkecepatan tinggi) memperluas, berbagi, dan memproses pool memori melalui interkoneksi berkecepatan tinggi, memutus keterikatan memori dengan prosesor tunggal dan menjadi jalur inti dalam menerobos batas kapasitas memori. Perkiraan Morgan Stanley menunjukkan bahwa kebutuhan AI akan mendorong ukuran pasar CXL dan chip memori terkait mencapai sekitar $6 miliar pada tahun 2030, jauh melebihi pasar perluasan memori CPU tradisional. Nilai inti teknologi ini ada pada pembangunan arsitektur memori bertingkat: data dengan frekuensi penggunaan tertinggi disimpan di HBM, data dengan frekuensi sedang masuk ke pool memori CXL, dan data dingin berfrekuensi rendah diturunkan ke NAND, dengan tingkat biaya yang sesuai dengan frekuensi akses data.
Pada aspek lini investasi, Morgan Stanley menegaskan kembali tiga arah utama: Pertama, terus overweight Micron dan SanDisk karena penurunan spesifikasi didorong kekurangan pasokan, bukan karena melemahnya permintaan; permintaan memori AI terus tumbuh dalam jangka panjang dan kekurangan pasokan akan bertahap menyerap kapasitas produksi. Kedua, investasi pada pemimpin interkoneksi CXL dan scale-up seperti Astera Labs dan Marvell. Ketiga, memantau pemain inferensi heterogen seperti Cerebras, serta Nvidia yang memperkuat portofolio inferensi heterogennya melalui akuisisi Groq.
Peringatan risiko: Pertumbuhan permintaan daya komputasi AI lebih lambat dari ekspektasi; implementasi teknologi CXL lambat dari ekspektasi; kapasitas produksi memori meningkat di luar ekspektasi.
Disclaimer: Konten pada artikel ini hanya merefleksikan opini penulis dan tidak mewakili platform ini dengan kapasitas apa pun. Artikel ini tidak dimaksudkan sebagai referensi untuk membuat keputusan investasi.
Kamu mungkin juga menyukai
TSMC merebut pasar Intel, berunding kerja sama Terafab dengan Elon Musk, harga saham capai rekor tertinggi
Saham TSMC di pasar saham AS naik 2,8%, sementara saham Intel yang bergabung dengan proyek Terafab pada April tahun ini turun 2,6%. Elon Musk mengonfirmasi di media sosial bahwa telah melakukan diskusi awal dengan TSMC mengenai proyek Terafab. Menurut laporan, para pelaku industri memperkirakan kemungkinan kerja sama antara TSMC dan Terafab lebih dari 80%.
Pendanaan chip AI tingkat rekor memulai distribusi: Obligasi senior senilai 42 miliar mengandalkan reputasi Broadcom, Obligasi subordinasi senilai 18 miliar harus menunggu IPO Anthropic
Menurut laporan, sekitar $42 miliar pinjaman terjamin senior yang dijamin oleh Broadcom telah memulai distribusi sindikasi lebih dulu; Bank Amerika, Citi, dan Morgan Stanley mulai mengalihkan sebagian utang tersebut ke bank lain. Dengan peringkat kredit A- dari Broadcom, pinjaman ini berpotensi masuk ke pasar penempatan privat atau pasar obligasi investasi. Selain itu, $18 miliar utang subordinasi tanpa jaminan Broadcom akan diluncurkan nanti, dan Blackstone telah berkomitmen untuk berlangganan sekitar $9 miliar dari jumlah tersebut.
