為什麼 context window 會卡在 1M 很多年? SemiAnalysis 談 40 年一遇的記憶體短缺

原始來源與檔名:2026-08-24T161848+0800-為什麼 context window 會卡在 1M 很多年? SemiAnalysis 談 40 年一遇的記憶體短缺.md


SOURCE | 資訊源評估

NAPKIN | 餐巾紙

ROUND 1: SKELETON | 骨架掃描

ROUND 2: DISSECTION | 血肉解剖

ROUND 3: SOUL | 靈魂提取

DEEP READ | 精讀指引


為什麼 context window 會卡在 1M 很多年? SemiAnalysis 談 40 年一遇的記憶體短缺 (Architectural Deep Dive)

前言/背景

本文基於 Latent Space 播客中 SemiAnalysis 的 Doug O’Laughlin 的訪談,探討為何大語言模型(LLM)的 Context Window 在未來幾年內難以突破 1M 量級。核心原因在於全球面臨 40 年一遇的記憶體短缺,這不僅是供應鏈問題,更是 KV Cache 帶來的物理與經濟限制。這對於依賴長 Context 的 AI 應用與 Agent 架構有著深遠影響。

章節詳細總結

40 年一遇的記憶體短缺成因

記憶體短缺由四個關鍵因素疊加造成:

  1. DRAM 微縮停滯:過去 50 年依賴製程進步降低每 GB 成本的規律失效。DRAM 記憶單元(Cell)已縮至極限(僅存幾萬顆電子),無法再藉由微縮降價。
  2. 擴產停滯:上一輪不景氣導致記憶體廠大砍資本支出,現今僅存 3-4 家供應商,無人在低點擴產。
  3. HBM 的產能乘數效應 (交換比):AI 加速器所需的 HBM 透過垂直堆疊封裝,良率耗損大。每製造 1 位元的 HBM,實質上會消耗 3-4 位元的標準 DRAM 產能。
  4. KV Cache 卸載耗盡 DDR5:推論系統為節省昂貴的 HBM,會將暫時未用的 KV Cache 卸載 (Offload) 至伺服器 DRAM,導致中階記憶體亦被搶購一空。

Nvidia 與 TPU 的加速器之爭:決戰供應鏈

Context Window 卡在 1M 的物理限制與 KV Cache 計算

這是一個軟體端無法輕易克服的物理限制,核心在於 KV Cache。模型在生成時,每個 Token 的 Key 和 Value 必須駐留在 GPU HBM 中。

Context Rationing (配給制) 與 Context Engineering

總結與結論

硬體發展的物理極限與供應鏈現狀已明確宣告:長 Context Window 是一項昂貴且稀缺的資源。在記憶體頻寬與容量未能產生跳躍式突破(如直接將記憶體堆疊於運算晶片上)之前,軟體架構必須轉向 Context Engineering。對於架構師而言,系統設計不應依賴將巨量文件一股腦塞給 LLM,而應構建具備精密記憶體管理、資料檢索與 Agent 協作機制的基礎設施。