評 Kimi K3:小鎮青年暴打資本家

Image

Image

原始來源與檔名:2026-07-20T100446+0800-评 Kimi K3:小镇青年暴打资本家.md


SOURCE | 資訊源評估

NAPKIN | 餐巾紙

餐巾紙公式

壟斷租金 = 能力稀缺性 × 閉源權重封鎖;K3 以 2.8T 開源權重把兩個因子同時壓低。 閉源前沿實驗室的超額利潤建立在「別人做不出 + 別人拿不到權重」兩道護城河上。K3 用尺寸把第一道河(能力差距)壓到「僅落後一檔」,用開源把第二道河(權重封鎖)直接填平,於是建立在這兩道河之上的「模型稅」與估值敘事同時鬆動。

一句話

Kimi K3 以 2.8T 超大尺寸主動放棄經濟性,再用開源權重把「模型稅」歸零,把算力封鎖劣勢反轉為動搖美國閉源前沿實驗室壟斷租金的不對稱武器。

餐巾紙草圖

┌ 中國 AI 三路線
├─ 做小(經濟性優先)
│   minimax-m3 / kimi k2.5 / hy3(激活 ~20B)
├─ DeepSeek 路線(性能 + 經濟性)
│   V3→V4 / GLM-5 / GLM-5.2
└─ Kimi 獨立路線
    K2(DeepSeek-V3 底盤分叉)
      └─ K2.5~K2.7(~1T / A32B,壓榨後訓練)
            └─ K3(2.8T / A50B,回歸預訓練擴張)


        犧牲經濟性(64 卡 / $3-$15)
                  ×
        開源權重(任意集群可部署)


    ┌ 動搖閉源壟斷租金
    ├─ Anthropic「不可替代性溢價」敘事崩塌
    ├─ 不對稱競爭:中國模型 + 美國集群 VS 美國閉源
    ├─ 取消「模型稅」→ 推理回歸成本定價
    └─ 衝擊 AI CapEx 鏈條上游回報


        Too Big to Fail:往大了做就不會輸

ROUND 1: SKELETON | 骨架掃描

章節骨架(條列)

ROUND 2: DISSECTION | 血肉解剖

論證鏈(ASCII)

K3: 2.8T 總參 / A50B 激活 / 本家技術棧 / 開源

  ├─ 尺寸 scaling law
  │     └─ 進入最高能力組(官方:僅落後 Sol / Fable)

  ├─ 主動放棄經濟性(64 卡部署 / API $3-$15)
  │     └─ 意圖 ≠ adoption,而是前沿標準定義權

  ├─ 開源權重(任意推理集群可部署)
  │     │
  │     ├─ 推理價格從「閉源上游想收多少」
  │     │     回歸「高效集群跑成功任務的成本」
  │     │           │
  │     │           └─ 取消附著於算力的「模型稅」
  │     │                 │
  │     │                 └─ 下游毛利系統性下降
  │     │                       │
  │     │                       └─ 上游(GPU)可議價彈性變差
  │     │                             → AI CapEx 敘事失序
  │     │
  │     └─ 形成不對稱組合:
  │           中國開源模型 + 美國 / 全球推理集群
  │                VS 美國閉源前沿實驗室

  └─ 動搖 Anthropic「不可替代性溢價」商業敘事
        ├─ GLM-5.2:多數任務勝 Opus 4.8,價格 1/5
        ├─ GPT-5.6 Sol:最高檔正面撞 Fable
        └─ K3:開源版「僅次 Sol/Fable」
              → SemiAnalysis 6 萬億估值推演(7/8)一個月內幻滅

三個關鍵證據

隱形假設與邊界

ROUND 3: SOUL | 靈魂提取

作者盲點

知識連接

行動觸發

留白提問(2 題)

  1. 若「往大了做就不會輸」為真,為何 OpenAI 在 o1 之後選擇把基座做小、押注 test-time compute?這是策略失誤、任務特性差異(形式推理 vs. 複雜非形式任務),還是 GPT-5.6 Sol 重新做大尺寸其實已經是路線回歸的承認?
  2. K3 級別模型的預訓練成本在開源、不收模型稅的模式下由誰長期吸收?這個資金迴圈可以維持幾代擴張,才能讓「Too Big to Fail」從一次性震撼變成可複製方法論?

跨域映射

DEEP READ | 精讀指引

STRUCTURE MAP | 全文結構圖

評 Kimi K3:小鎮青年暴打資本家(@0xcherry, 2026-07-19)

├─ 1. 三駕馬車 ─────────── 分類:做小 / DeepSeek / Kimi
│     └─ 定位 K3 = 獨立技術棧 + 極大尺寸 + 不惜代價追高性能

├─ 2. K3 怎麼這麼大 ─────── 技術脈絡
│     ├─ K2 = DeepSeek-V3 底盤分叉(384 專家 / heads 減半 / MuonClip)
│     ├─ K2.5~K2.7 = ~1T/A32B,靠後訓練壓榨
│     └─ K3 = 2.8T/A50B,回歸預訓練規模擴張 [圖 3]

├─ 3. 公共事業 → 特權壟斷 ── DeepSeek 完成 adoption;前沿問題待解

├─ 4. 項莊舞劍 ─────────── K3 不為 adoption,為前沿定義權

├─ 5. 牢 A の永動物語 ──── 揭穿 Anthropic「不可替代性溢價」
│     └─ 7/8 SemiAnalysis 6 萬億估值 → 7/9 Sol 掀翻

├─ 6. 誰殺死了知更鳥 ────── GLM-5.2 + Sol + K3 接力動搖價格錨 [圖 4]

├─ 7. 不對稱競爭 ────────── 開源權重把劣勢武器化
│     └─ 中國模型 + 美國集群 VS 美國閉源

├─ 8. 誓死效忠美光! ────── 取消「模型稅」→ 衝擊 AI CapEx 鏈條

├─ 9. Too Big to Fail ──── 方法論:往大了做就不會輸
│     └─ 強模型可蒸餾下沉;弱模型難靠思考補能力

└─ 10. 結語 ────────────── 小鎮青年暴打資本家

評 Kimi K3:小鎮青年暴打資本家(Architectural Deep Dive)

前言/背景

本文是獨立研究員 @0xcherry 對 Kimi K3 的戰略評論,發布於 2026-07-19。它並非要點式測評 K3 的 benchmark,而是把 K3 放進「中國 AI 三條路線 → 中美算力地緣博弈 → AI 資本開支敘事」的三層結構裡,論證一個命題:一個主動放棄經濟性、開源、尺寸極大的中國模型,正在動搖美國閉源前沿實驗室建立在「能力稀缺+權重封鎖」之上的壟斷租金與估值錨。讀這篇要帶兩個濾鏡:一是作者的隱喻外衣下藏著可查證的技術規格與時間線,二是若干策略推論(CapEx 衝擊、不對稱競爭的可持續性)屬分析者立場而非已驗證結論。

章節詳細總結

中國 AI 的三駕馬車

作者把中國 AI 模型切成三條技術路線,這個分類是全文的座標系:

作者補了一個關鍵的部署現實:雖然 K3 相比 Claude 仍非常便宜,但 Kimi 推理集群在中國境內,考慮到「卡數量的限制」,Kimi 大概率沒有把經濟性當首要要求來做 K3。結論:K3 是一個獨立技術棧、尺寸極大、不惜一切代價追求高性能的產物;它誕生伊始的目標就不是做更好的 R1,而是對標 OpenAI 與 Anthropic 最前沿的超大尺寸模型。這段把「尺寸 scaling law」當作核心機制——總參數擴大帶來能力躍升,但激活比例(K3 約 50B/2.8T ≈ 1.8%)仍受超稀疏 MoE 控制而維持可部署性,只是部署門檻(64 卡)與單價被推高。

K3 怎麼這麼大?

作者先校正一個可能的誤讀:把 Kimi 描述成「從來與 DeepSeek 毫無關係的獨立技術路線」並不準確。K2 的論文寫得很清楚

因此,K2 更像 DeepSeek-V3 式底盤上的 Kimi 分支,而不是從零開始的另一物種。這裡的工程意義是:MLA(Multi-head Latent Attention)透過把 KV cache 壓縮進低秩潛在空間來降低長上下文的顯存壓力,超稀疏 MoE 則讓總參數可以做大、而激活參數保持小,兩者合起來正是「大尺寸+可負擔推理」的關鍵;K2 在共享底盤上換掉專家數、attention heads 與優化器,是典型的「同架構不同配方」分叉。

真正值得注意的是:K2.5 到 K2.7 的基座尺寸基本沒有繼續擴張——總參數維持在 1T 左右、激活參數約 32B,仍是 384 個專家選 8 個。換句話說,Kimi 已經證明自己可以在不擴大基座的情況下,靠後訓練與 agent 系統把同一個底盤壓榨很多代。這對應的策略是「固定基座+滾動式後訓練/RL/工具環境」的性價比路線。

Image

但 K3 不同。K3 因而不是一次普通的版本升級,而是 Kimi 主動結束「在既有基座上繼續做後訓練」的階段,重新回到預訓練規模擴張。K3 大量使用過去分散的本家技術——本家訓練基座、本家注意力機制、本家專家路由結構——到這一步,K3 與 DeepSeek 的親緣關係已較為疏遠。K3 同時要證明兩件事:一是 Kimi 能夠定義自己使用的技術範式;二是 Kimi 有資格用全新技術去訓練全新的超大尺寸模型,對標 OpenAI 與 Anthropic。作者判斷:事實證明,K3 成功了

從公共事業到特權壟斷

這段把 DeepSeek 的歷史角色定位為「中國 AI 的公共事業」:

但作者點出轉折:一個前沿實驗室遲早還要回答另一個問題——如果永遠只追求更便宜地接近別人,那更高性能的模型從哪來? 所有互聯網大廠都選擇了同一條路:想辦法繞開禁令,從美國進口。例如阿里的新加坡主體,讓用戶通過遠程登錄新加坡機器跑 Claude Code——「然後就被封了」。作者用一個反事實假設強化戲劇性:若非 Sam(OpenAI)很快補上 5.6-Sol 這一刀,Dario(Anthropic)還能再發幾篇文章「踩頭中國人」。

結論:中國透過大量工程優化已逐漸實現 AI 的公共事業化基石,但若沒有更大尺寸、更高性能的前沿模型,就會始終落後一個拍子,陷入長期不利的「特權競爭」。這裡的「特權競爭」指的是:算力管制使中國無法觸及最高能力模型,只能在不對等的「特权(被剝奪)」狀態下競爭。

項莊舞劍,意在沛公

K3 的 2.8T 就是 Moonshot 對「更高性能模型從哪來」這個問題的回答。作者用對比把 K3 的戰略意圖釘死:

對照大多數 PR 稿中「碾壓美國模型」的措辭,作者指出 Kimi 官方措辭更為溫和:K3 整體仍落後於 Fable 5 與 GPT-5.6 Sol。但「換個角度理解也很激進:只比 OpenAI 和 Anthropic 的最頂級模型差一點」。一旦進入這個檔位,K3 首先動搖的,就是 Anthropic 過去一年最重要的商業敘事。「項莊舞劍,意在沛公」——K3 表面是產品,真正打擊面是對手的商業故事。

牢 A の 永動物語

「牢 A」是中國網路對 Anthropic(A)的戲稱,「永動物語」諷刺其「永動機式」估值敘事。作者拆解 Anthropic 的方法論:

接著是敘事的高峰與崩塌:

誰殺死了知更鳥?

作者回顧自己曾系統性分析過 GLM-5.2 的重要意義(被讀者稱為「雄文」),並(自嘲地)聲明「智譜從未支付宣傳費,保持獨立研究員身分」。重點是 GLM-5.2 對 Anthropic 根基的動搖:

Image

不對稱競爭

這是全篇地緣博弈的核心。作者先把美國算力管制的邏輯說清楚,再揭示它的反作用:

關鍵的反轉邏輯濃縮成一句:

既然你不讓我賺超額利潤,我又不想被封鎖技術,那我做出來之後不要利潤不就完事了?

而且開源模型不挑顯卡——中國顯卡能部署,美國算力集群也能部署,Fireworks、TogetherAI,還有一大堆 NeoCloud,都有一堆顯卡。於是中美 AI 競爭出現了一種「極其抽象的組合」:

中國模型 + 美國及全球推理集群 VS 美國閉源 AI 實驗室

分工與損益的不對稱:

因此,美國面臨的不是「繼續制裁還是放開銷售」的簡單選擇,而是不可能三角

作者下結論:這是典型的不對稱競爭。華盛頓熱衷於講不對稱競爭,現在這個詞落回到華盛頓頭上了

誓死效忠美光!

「誓死效忠美光!」是作者的反諷標題(「美光」為 Micron,這裡借指 AI 硬體/CapEx 鏈條上游,象徵資本市場對硬體景氣的盲信崇拜)。這段把論證往 AI 資本開支敘事的上游再推一步:

這條鏈可寫成:

模型能力稀缺 → API 高價 → 下游高毛利 → 能夠承受 GPU 溢價 → CapEx 擴張 → 上游持續景氣。

接著是對 GPU 資本回報計算的反向改寫:

Too Big to Fail:大而不輸

作者把 K3 的 2.8T 總結為兩種「看似相反」的意義,並收束到方法論:

接著作者反駁「夠用就好」的端側/小尺寸路線:

核心的不對稱性(全篇方法論結晶):

作者用產業史佐證這個方法論的循環與反轉:

結語:小鎮青年暴打資本家

作者用一個強烈的對位隱喻收束全篇:

總結與結論