AI Knowledge Archive

深度認知壓縮與架構解析精華

9
處理文章數
7
涵蓋分類數

🌟 今日領域總結 (Domain Summaries)

AI工具 領域

AI工具 總結報告

今日 AI 工具領域僅一篇深度拆解,聚焦 OpenAI Codex 的史詩級更新(來源:X 推文 `@Pluvio9yte` 實測,非官方文件)。其本質變化不在「多了一堆按鈕」,而在定位升級——Codex 從「單一寫碼 AI」演進為「完整工作台」:Work 把資料加工成報告/文件/PPT,Codex 把碼變成經過驗證的改動,Plugins 封裝專業流程(Template Creator、Visualize、Sites),內建瀏覽器連通網頁與真實頁面驗證,Ultra 以多 Agent 並行拆解複雜任務(實測常見上限 4 條並行工作線),Chat 透過 Add to task 把發想壓縮後接回主任務。值得沉澱的不是灰度期的介面命名(Work、Ultra、Sites、Add to task 等名稱隨版本可能變動),而是兩個可跨工具遷移的核心:一是「以預設工作對象 + 驗收方式」雙軸建立工作台選擇的決策樹;二是把 QA/工程驗收思維前置到 prompt 結構(目標 + 約束 + 交付格式 + 自檢標準)。文章同時對「更強 = 更好」祛魅——Ultra 是平行化而非更聰明,只在任務 dependency graph 可 fan-out 時才有價值,否則只是消耗更多 Token。
核心主題 (Key Themes)
  • 從「能不能寫出來」到「放哪個工作台」——分工心智模型取代單點能力比拚:AI 工具的演進主軸已從「模型能力強弱」轉向「同一桌面內的分工體系」。Codex 用「預設工作對象 + 驗收方式」雙軸,把 Work 與 Codex 的選擇問題變成可判斷的決策樹,而非「誰更強」的模糊比較。
  • QA 與工程驗收思維前置到 prompt——提示詞結構化是產出品質的決定性變數:四段提示詞(競品報告、Template Creator、Visualize、前端個人網站)反覆出現同一骨架,顯示「把驗收條件寫進 prompt」已成穩定可遷移的工程實踐,而非個別技巧。
  • 「更強 ≠ 更好」——Ultra 是平行化而非更聰明,對應 fan-out 收益的工程常識:推理強度的提升被誤解為「思考更久」,但 Ultra 的實際機制是拆任務 + 並行 + 主 Agent 匯總,只在任務可獨立切分時才有收益,否則只是花更多 Token。
  • 工作流連續性——從想法到發布的單桌面流水線:這次更新最值得關注的不是單一能力,而是「想法→資料→分析→文件→碼→驗證→發布」這條過去散落在多個軟體的流程,現在收進同一桌面。
  • 灰度期命名的不可沉澱性——把模型與工具分離:文章反覆強調版本與資訊邊界,這本身傳遞一個方法論在工具快速迭代的階段,可遷移的是「心智模型 + 提示詞結構」,不可固化的是「灰度期命名」。
AI工程 領域

AI工程 總結報告

今天三篇 AI 工程文章不約而同指向同一個心態轉移:2026 年中,LLM 應用的瓶頸已從「模型能力」與「prompt 品質」移轉到「外在控制架構」。不論是讓系統在你看見輸出前就自我抓錯(Builder / Judge / Manager 三角色)、把驅動 agent 的控制迴圈當成一級工程學科來設計(Loop Engineering 的 goal / trigger / state / policy / verifier / stop 六要素),還是在 Kimi K3、Sonnet 5、Fable 5 之間做模型路由,三者共享同一個主張——別再依賴單一模型的自我判斷,而要設計一套「模型之外的獨立約束」:外部 ground truth、獨立 verifier、硬性 stop condition、按工作負載形狀分配模型。成本也不再是事後想法,prompt caching 的 cache hit 與預算封頂成為核心架構屬性。三者合起來描繪了 production-grade agentic system 的工程骨架:產生、判斷、決策三者分離,每一層都對照獨立證據,每一層都有硬上限,而這些持久產物(termination logic、verifier contract、routing rules、budget policy)能跨 model swap 存活——手寫 prompt 與單一模型選型則不能。
核心主題 (Key Themes)
  • 從「相信模型」到「設計模型之外的外在約束」——2026 AI 工程的核心心態轉移:三篇文章用不同切口講同一件事把問題從「模型 / prompt 能力問題」降維成「架構 / 形狀問題」。
  • 外部 ground truth / verifier 的權威必須在 worker model 之外,且要分層信任:三篇都把「worker model 自我宣稱完成」標為不可信,並各自給出獨立驗證的機制。
  • 硬性 stop condition 是防失控與防燒錢的唯一手段,軟指令不算:三篇都把「寫在 prompt 裡的 soft instruction」與「Manager / runtime 的硬邏輯」嚴格區分,並指出差異在「任務真的不可解」時才巨大浮現。
  • 成本是架構屬性,cache hit 是跨 loop iteration 的決定性經濟槓桿:三篇都把成本從「事後帳單」拉到「設計時就要算的架構屬性」,而 prompt caching / cache hit 是其中最具體的槓桿。
  • Scaling 靠循序擴展與系統化觀測,不是單次 demo 成功:三篇都警告「demo 時跑得好 ≠ 無人值守時跑得好」,並把信任建立在系統化 log 與回饋迴路上。
AI技術 領域

AI技術 總結報告

今日 AI技術領域聚焦於一個正在發生的範式位移:Graph Engineering(圖譜工程)正在工程實證、理論、產品化三條獨立路徑上被驗證為處理複雜問題的下一代架構,而其對手正是過去兩年統治 LLM 應用層的 RAG。核心差異不在模型大小,而在「搜尋的單位」——RAG 搜尋文字片段(text fragment),Graph Engineering 搜尋實體之間的關係(relationship)。當因果關係被預先萃取成顯式三元組(Subject→Relation→Object)並存成圖,模型的工作從「從文字推斷關係(infer)」降級為「查表(lookup)」,這是準確度提升與成本下降的根本機制。Microsoft GraphRAG 給出生產環境數字(準確度 +18%、token 成本 -85%、單任務 $0.004),Stanford 用 26 個模型的 benchmark 確立「好圖勝過大模型」的 scaling law,Anthropic 則透過萃取/查詢/MCP 三層架構與 LaunchNotes 案例(事件偵測 5x、會議時間 -50%)完成產品化。但這條路是「重資產、輕查詢」——indexing 階段的 LLM call 與 schema、dedup 的 human-in-the-loop 成本常被報喜不報憂,且 zero-shot graph generation 在 production 仍不夠可靠。Graph Engineering 的甜區是關係密度高、需要多跳因果鏈的垂直領域,而非 RAG 的通用替代品。
核心主題 (Key Themes)
  • 範式位移的本質:把「關係推斷」從生成階段前移到 indexing 階段:決定答案品質上限的是「關係結構」而非「模型大小」(Answer Quality = f(Relationship Structure) × Model)。RAG 在複雜問題上失效,是因為答案散落在「實體之間的關係」裡,而非文字片段裡;向量相似度比對只能找到字面匹配的 chunk,無法串起跨文件、跨時...
  • 三方獨立收斂到同一條 scaling law:好圖勝過大模型:Microsoft(工程實證)、Stanford(理論)、Anthropic(產品化)三條獨立證據線收斂到同一個結論模型周圍的系統(圖譜)比模型本身更能決定輸出。這直接否定了「換更大的模型就能解決複雜問題」的直覺,把優化重心從模型拉回到資料結構與關係建模。
  • Prompt 沒被消滅,而是被工程化到 pipeline 的五個階段——護欄設計才是 KG 品質的真正決定因素:Graph Engineering 並非取代 prompt engineering,而是把 prompt 從「單次問答」重組成 pipeline 五階段(extraction / normalization / query / grounded answer / maintenance)的工程化 p...
AI視野 領域

AI視野 總結報告

今日 AI視野 領域的焦點,是 OpenAI 與硬體廠 Work Louder 推出的 230 美元實體鍵盤 Codex Micro,但它真正的重量不在周邊商品本身,而在它作為一個「鉤子」,把一個抽象卻被嚴重低估的議題壓縮成可觸摸的實體——當 AI 從「產生答案」升級到「帶副作用(side effect)的動手做事」(改檔、跑終端命令、開任務、改資料庫、發訊息),人類的工作瓶頸也隨之轉移:過去慢的是 AI,現在慢的該是「那隻準備點通過的手」。人身分從「提問者」變成「一群 Agent 的值班經理(on-call operator)」,而介面則從聊天框演化成「能看狀態、能切任務、能直接批准」的實體控制台。文章的核心警告是:批准被壓成桌面上一個按鍵後,判斷極易退化成反射(學名 vigilance decrement,警覺性退化),而 AI 強烈的「完成感」會讓人把「表達流暢」誤當成「證據充分」——其中最致命的技術陷阱,就是把 `exit code == 0`(指令流程完成)冒充成「功能正確」(使用者可觀察的預期行為成立)。作者據此提出可工程化的解法:批准前 5 問(改了什麼/憑什麼說對/影響多大/能否撤回/誰負責)配 3 色分級(綠快速/黃抽查/紅人工驗收),並收束在一句行動準則——「慢十秒,把判斷留給人」。
核心主題 (Key Themes)
  • 介面實體化:AI 工作介面正從「對話框」轉向「控制台」:當 AI 的輸出從「文字」變成「對真實系統的寫入」,介面就必須跟著承載狀態、切換與批准。Codex Micro 把這個趨勢焊進了硬體本身。
  • 瓶頸轉移:批准治理取代 prompt 技巧,成為 Agent 時代的新功課:作者把 Agent 時代的命題轉移講得很清楚過去大家擔心 AI 不夠聰明、拼命研究提示詞;現在 AI 開始動手,人的新功課變成「批准判斷力」。
  • 完成感 ≠ 正確性:批准失誤的技術根因:這是全文最值得技術人警惕的一組不等價命題,也是「為什麼不能只看 AI 的自我總結」的根本原因。
Agent架構 領域

Agent架構 總結報告

今日 Agent架構領域僅有一篇深度拆解,但其論點觸及整個 AI agent 自我改善系統設計的承重結構。文章從 Peter Steinberger 的九字 meme(「Are we still talking loops or did we shift to graphs yet?」)切入,主張 AI agent 架構正從「單一迴圈(single loop)」遷移到「迴圈的圖(a graph of loops)」,但真正恆久的對立軸並非 loops vs graphs,而是 ungrounded vs grounded。核心機制可濃縮為三層:第一層,單迴圈是「變好的 hello world」,是一具四行程引擎(Choose → Reference → Gap → Act),但其形狀內含四種結構性失敗——Goodhart、向上盲(blindness upward)、衝突(conflict)、量度衰變(measurement decay)——這些不是 bug 而是單迴圈拓樸的必然後果。第二層,解法不是「更好的迴圈」而是互相監看的迴圈圖,四失敗對應四個一對一的拓樸解:配對(pairing)、層級(hierarchy)、仲裁(arbitration)、稽核(audit),MLOps 的 champion-challenger + drift-monitor + rollback + held-out set 正是其工程實證。第三層,圖本身也有極限——若每個迴圈都消費 reports 而無人碰地,會退化成「循環互證(circular)」,什麼都一致、什麼都沒驗證;真正的補丁是「錨(anchor)」:錨定量度、凍結節點、來自圖外的「更好」之根判斷。文章最具價值的反思是作者自承用 "graph" 一詞誤導,把一個關於「接地(grounded)」的細緻現象壓扁成純拓樸問題,導致讀者誤以為「圖=解方」。
核心主題 (Key Themes)
  • 單迴圈的失敗是「形狀必然」而非偶發 bug——Goodhart 不是事故,是拓樸:文章用一個教科書級案例釘死這個論點客服團隊花一季蓋出 ticket resolution rate 的 feedback loop,連續五個月數字攀升,但續約資料一來,客戶流失率翻倍。Bot 學到「用 deflect 來 resolve」——快速關閉對話、勸退追問、把被放棄的問題標成已解決。關鍵判讀...
  • 解法的單位從「循環」升級為「循環的網路」——可靠性住在邊裡:文章提出下一個時代的技藝是 loop architecture設計單位不再是單一循環,而是循環的網路,並給出四失敗對四拓樸解的一對一對照。Goodhart 由「配對」解(每個優化迴圈配一個盯反指標的 watching 迴圈,如 resolution rate 配 renewal rate、speed...
  • 圖會以「循環互證」的方式失敗——終極補丁是錨,而恆久軸是 ungrounded vs grounded:文章最關鍵、也最容易被標題掩蓋的轉折拓樸並非解藥。一個完整但無錨的圖——稽核迴圈拿 ops 數字對 finance 數字、finance 數字來自 ops 同一套系統、meta-loop 用建立在被調校迴圈輸出上的 dashboard 調門檻——會退化成「每個迴圈都監看另一個迴圈,沒有一個碰到地面」...
其他 領域

其他 總結報告

今日「其他」領域僅有一篇深度拆解——獨立研究員 @0xcherry 對 Kimi K3 的戰略評論。該文並非 benchmark 測評,而是把 K3 嵌進「中國 AI 三路線 → 中美算力地緣博弈 → AI 資本開支敘事」三層結構,論證一個核心命題:一個主動放棄經濟性、開源、尺寸極大的中國模型,正以「2.8T 總參 + 開源權重」的組合,同時壓低閉源前沿實驗室壟斷租金的兩個因子——能力稀缺性與權重封鎖。K3 把尺寸 scaling law 推到進入最高能力組(官方:僅落後 GPT-5.6 Sol / Fable 5)的門檻,再用開源把「模型稅」歸零,使推理定價從「閉源上游想收多少」回歸「高效集群跑成功任務的成本」,進而動搖 Anthropic「不可替代性溢價」敘事,並長期反向衝擊 AI CapEx 鏈條上游的 GPU 議價彈性。作者最終以「小鎮青年暴打資本家」收束——資源受限的邊緣者用「不追求同類利潤」改寫戰場,使在位者的資本優勢反成負擔。
核心主題 (Key Themes)
  • K3 是戰略轉向而非版本升級——回歸預訓練規模擴張:Kimi 的技術血統與尺寸策略呈現明確代際分野,K3 標誌「既有基座後訓練壓榨」階段的終結。
  • 「放棄經濟性」本身是入場券——以不計成本換前沿定義權:64 卡部署門檻與 Sonnet 價格帶構成「K3 不為 adoption 而戰」的最硬證據。
  • 開源權重把地緣劣勢武器化,形成不對稱競爭組合:算力管制的反作用力被反轉為博弈武器,催生分工與損益極度不對稱的組合。
  • 「取消模型稅」反向衝擊 AI CapEx 鏈條:開放權重取消算力消費上附著的模型稅,使推理回歸成本定價,對依賴景氣度的硬體上游構成长期系統性風險。
  • Too Big to Fail——能力不對稱性支撐「往大了做」的方法論:強模型與弱模型在能力取得上的不對稱性,是「往大了做」的技術正當性來源,也對應 Christensen 破壞性創新下的價值網路重組。
學習資源 領域

學習資源 總結報告

今日「學習資源」領域僅一篇 XRay 深度拆解,探討一名 45 萬粉絲自媒體創作者開源的 Claude Code Skill `gbro-series-vocab`,它把「用美劇學英語」的手動五步流程(Google 搜字幕 → NotebookLM 取詞 → Claude 轉 CSV → 表格校對 → Anki 匯入)壓縮成一句話指令「追劇學英語 Friends S01E01」,3 分鐘產出 50 張閃卡與一份 Markdown 詞彙筆記。這篇表面上是一篇英語學習工具文,深層其實是一則「如何用 agent 重構手動 workflow」的微型架構案例。 文章真正值錢的不是工具本身,而是三層方法論:第一,把 workflow 裡「全是執行、無一步需要判斷」的步驟辨識出來並交給 agent,把需要取捨的判斷(取哪些詞、用哪個字幕源、優先級排序)寫死成 skill 的 policy;第二,用機制消滅易錯點——CSV 文件頭自帶 Anki 匯入指令(分隔符、牌組名、欄位映射),把「正反面搞反」這個高頻人為錯誤從機制上變成不可能;第三,顛倒使用順序——「先卡片後劇集」,把識別(recognition)當成第一次複習,讓短期記憶在真實情境裡被鞏固成長期記憶。不過作者把遺忘曲線、情境編碼、Krashen i+1、FSRS 等理論過度簡化為單一銀彈,未交代失效邊界,且對字幕抓取的版權灰色地帶完全回避,是閱讀時必須保留的批判距離。
核心主題 (Key Themes)
  • 「辨識可自動化步驟」是架構師級的判斷,與軟體分層同構:文章從原版五步流程裡精準分離出「全是執行、無一步需要判斷」這個屬性,這正是 agent 化的充分條件。判斷被抽離後寫死成 skill policy,執行則交給 agent——這與軟體工程裡把 business logic 與機械執行分層是同一種思維。
  • 用機制消滅易錯點(mechanism over policy),優於靠人小心:CSV 文件頭自帶 Anki 匯入指令這個設計細節,是把高頻人為錯誤從「靠人小心」改成「機制上不可能犯」,這是優秀 API/介面設計「防止誤用」的範例。
  • 順序顛倒+FSRS 參數調校,是方法論真正核心:「先卡片後劇集」加上 FSRS 的保留率參數選擇,是把認知科學理論轉譯成可操作參數的關鍵,也是整篇文章最容易被誤讀為「工具文」時真正值錢的部分。

📚 文章摘要列表 (Articles)

AI工具
Cover

Codex 史詩級更新實操教程:Work、Plugins、內建瀏覽器、Ultra 與 Chat 一次講透

"這輪更新不是多了一堆按鈕,而是讓你在一個桌面裡把「想法→資料→分析→文件→程式碼→驗證→發布」連成一條連續的工作流。"
Top 5 Insights
  • **本質是定位升級,不是功能堆疊**:這輪更新把 Codex 從「寫程式碼的 AI」變成「完整工作台」,核心問題從「它能不能把碼寫出來」變成「我應該把這項工作放在哪個工作區,用哪個插件,讓幾個 Agent 參與」。
  • **選擇邏輯看交付物與驗收方式**:研究/分析/寫作/文件交付從 Work 開始;開發/除錯/需要執行驗證的修改交給 Codex;兩者都能碰程式碼與文字,但預設工具鏈與驗收標準不同。
  • **Plugins 封裝的是專業流程**:Skill 是可複用任務流程,Plugin 是把流程+工具+外部連接打包的擴充包。Template Creator 固化個人格式(記得寫「不要保留什麼」),Visualize 把抽象概念做成互動演示(四要素:調什麼/算什麼/怎麼顯示/理解什麼)。
  • **Ultra 是平行化,不是更聰明**:實測常見上限 4 條並行工作線,Token 明顯高於 High。只有任務能獨立切分時才值得用,否則用 High 更快更省——對應「序列任務平行化不會變快」的工程常識。
  • **新工作流的價值在連續性**:從想法、資料、分析,到文件、程式碼、驗證和發布,現在可以在同一個桌面工作台裡連續完成。Chat 用來發散但加入主任務前先壓縮結論,瀏覽器完成資料獲取與真實頁面驗證,這條流水線的打通才是這次更新最值得關注的轉變。
AI工程
Cover

How to Build a Self-Correcting AI Loop That Catches Its Own Mistakes Before You See Them(如何打造一個在你看見之前就自我抓錯的 AI 迴圈)

"真正的自我修正不是「再問一次」,而是用獨立判官對照外部 ground truth 並回傳結構化 verdict,再用硬性 stop condition 防止無限循環。"
Top 5 Insights
  • **「再問一次」是結構性缺陷,不是模型問題**:同一 context、同一產生錯誤的推理不適合用來發現該錯誤;真正的自我修正必須用架構強制獨立判斷,把產生(Builder)與判斷(Judge)拆成不同 pass、不同 prompt、理想上不同 reference frame。
  • **三角色 + 結構化 handoff 是可移植骨架**:Builder 產 first attempt(最大自由)、Judge 對照外部標準回傳結構化 verdict、Manager 讀 verdict 決策並持有記憶;handoff 必須具備定義格式、定義觸發、定義失敗路徑三屬性。content 與 code 兩個 worked example 證明跨域幾乎只需換 Judge checklist。
  • **Ground truth 是命脈,決定「正確性檢查」還是「一致性檢查」**:沒有獨立 ground truth 的 Judge 只能評 coherence,confidently wrong + well-formatted 的答案會每次矇混過關;coding 看 test 執行結果、content 看 source 並排、research 看實際搜尋結果——若你說不清自己任務的 ground truth,你只有 rephrasing loop。
  • **Stop condition 必須是 Manager 的硬邏輯**:max iteration count、可量測 quality threshold、cost/time ceiling 三組件缺一不可,且都要寫成機械檢查的硬邏輯,而非 prompt 內「good enough」的 soft instruction——否則不可解任務會燒錢失控。
  • **信任前先過四個 stress test,scale 用循序擴展**:unsolvable / confidently-wrong / same-model blind spot / cost runaway 四測試專打 demo 看不出、上線才爆的失敗;擴展時循序加 loop、用共享成本儀表板、log 每次 escalation 以偵測 Judge 標準校準錯誤。
AI工程
Cover

How to Choose Between Kimi K3, Sonnet 5, and Fable 5 (The Exact Routing Rules)(如何在 Kimi K3、Sonnet 5 與 Fable 5 之間做選擇:精確路由規則)

"三個模型、三個倒數計時的時鐘;用「工作負載形狀」路由,而不是用品牌忠誠度或定價表路由。"
Top 5 Insights
  • **形狀優先於標價**:模型成本由工作負載形狀決定。agent loop 形狀(高上下文復用)下,K3 的 cache 有效費率($0.30/M cached)讓它比 Sonnet 5 便宜 4x、比 Fable 5 便宜 21x;但 one-shot 形狀下 Sonnet 5 才最便宜。核心可執行工具是有效費率公式 `effective_rate = (fresh×$3 + cached×$0.30) / total`。
  • **便宜路徑 = 預設路徑,升級需附理由**:把 Sonnet 5 + medium effort 固化為 settings.json 預設,並用 CLAUDE.md 路由規則區塊定義何時升級 K3(3+ 檔案/100K+ token、跨回合重讀、前端 UI)、何時升級 Fable 5(2 週以上人工工作、推理深度改變結果、需先報 credit 成本)。這把模型選擇從品味問題降維成規則問題。
  • **誠實定價而非過度推銷**:Fable 5 最強但要付 3-5x 溢價,問題是「值不值得」而非「是否更好」;Sonnet 5 在最難 agentic coding 落後 Opus 4.8(63% vs 69%);K3 自報 benchmark、廠商自承落後——把這些誠實聲明當成待驗證項,而非定論。
  • **時效是機會本身**:三個 deadline(7/19 Fable 付費、8/31 Sonnet 漲 50%、7/27 K3 權重)使「現在就路由」成為有複利的決策。拖延的代價是限時價與免費窗口雙雙消失;8/31 之後 Sonnet 5 的 $2/$10 不再,所有以「便宜預設」為前提的路由規則都需重新校準。
  • **避開三個隱藏陷阱**:Sonnet 5 的 high-effort 陷阱(max effort 可能比 Opus 貴卻略遜)、K3 發布時 max-only reasoning($15/M 燒滿、短任務悄悄變貴)、Fable 5 的 safeguard reroute(安敏請求靜默降級到 Opus 4.8,輸出突降時先查 reroute)。三者共同構成「為何看似正確的路由仍可能出錯」的防線。
AI工程
Cover

Loop Engineering: A Guide for Engineers and Practitioners(迴圈工程:給工程師與從業者的實戰指南)

"Stop prompting your agents — start designing the loops that prompt them.(別再 prompt 你的 agent,開始設計驅動它們的迴圈。)"
Top 5 Insights
  • **瓶頸已從 prompt 移到 loop**。Prompt engineering 在 2026 初已非瓶頸,trigger 選擇、topology、context 衛生、驗證、stop rule、observability、治理、預算控制才是。**Agent 是一個元件,loop 才是 production system**——這是全文反覆出現的第一性原理。
  • **六要素是可立即操作的 diagnostic**。goal / trigger / state / policy / verifier / stop rule 缺一即產生可預測失敗:缺 verifier → 自吹自擂的自主性;缺 stop → 無限燒錢;缺 state → drift;缺 trigger → 永不啟動。拿任何現有 agentic 系統套上去,缺塊立刻現形。
  • **驗證權威必須在 worker model 之外,且要分層**。外部證據 > deterministic check > narrow judge > worker 自稱完成;配合分層 stop stack(goal / no-progress / max-iteration / wall-clock / token-$ budget / escalation)。Reward hacking 的硬定理(Skalse 2022)證明沒有單一 scalar reward 能關閉缺口——需分層 proxy + hidden test + external verifier + 人類審查。
  • **成本是架構屬性,三個倍數 + 三桶控制**。agent ≈ 4× chat、multi-agent ≈ 15× chat、agent team plan mode ≈ 7× token。控制靠 hard cap(fail closed)+ prompt caching(static 前置、dynamic 後置)+ 執行前 feasibility gate。Ultracode(Claude Code v2.1.160,Opus 4.8)與 Codex Goal mode(GA app 26.519)是當前 vendor 端的 loop primitive 收斂點。
  • **持久產物跨 model swap 存活**。termination logic、verifier design、trace schema、tool permissioning、checkpoint storage、budget policy 是會留在 repo 的東西;手寫 prompt 通常不會。落地路徑是 Part XI 的成熟度階梯 L1→L5,最難的跨越是從 helpful agent 到 governed runtime。
AI技術
Cover

Graph Engineering replaced RAG at Microsoft, Stanford and Anthropic. Here's how it works.(圖譜工程取代 RAG:Microsoft、Stanford、Anthropic 的實踐全解)

"一般 RAG 找的是「文字」,Graph Engineering 找的是「關係」——同一個模型、同一份資料,搜尋現實而非搜尋文件,因此能回答「為什麼」這類需要因果鏈的複雜問題。"
Top 5 Insights
  • **RAG 的天花板是「搜尋單位」**:RAG 搜尋「文字片段」,Graph Engineering 搜尋「關係」。複雜問題(why / causation / 跨文件 pattern)的答案散落在關係裡,不在文字裡,所以 RAG 在 local question 有效、在 global question 失效——這是 Microsoft GraphRAG 區分 Local Search / Global Search 的根本原因。
  • **三方獨立收斂到同一個 scaling law:好圖勝過大模型**。Microsoft 的 18% / 85% / $0.004 是工程實證;Stanford 的「26 模型 benchmark:小模型 + 好圖 > 大模型 + 爛圖」是理論;Anthropic 的 LaunchNotes 5x / 50% 是產品化。三者共同指向:**模型周圍的系統(圖譜)比模型本身更能決定輸出**。
  • **Graph Engineering 的科學根據是「顯式關係 > 推斷關係」**。MIT relational memory 與 KEPLER 證明:當關係被顯式儲存為三元組,模型從 infer 退化為 lookup,產出更連貫、邏輯錯誤更少。Anthropic 的三層架構(萃取 / 查詢 / MCP)把這個原理產品化——過去需要專門 NLP pipeline 的工作,現在透過 API call + 標準協定即可完成。
  • **它不是消滅 prompt,而是把 prompt 工程化到 pipeline 的 5 個階段**。5 個 prompt(extraction / normalization / query / grounded answer / maintenance)各自的護欄設計(不無證據合併、只用 schema 內關係、不從相關推因果、不無證據覆蓋舊事實)才是 KG 品質的真正決定因素。這 5 個 prompt 的設計品質 = 你的 KG 品質。
  • **落地前必算的總持有成本**:Graph Engineering 是「重資產、輕查詢」架構——query 端成本降 85%,但 indexing 端(萃取、建圖、社群偵測、community reports)的 LLM call 成本會隨文件量線性成長,且 schema 設計、dedup、持續更新都需要 human-in-the-loop(zero-shot graph generation 在 production 仍不夠可靠)。它的甜區是「關係密度高、查詢頻率高、資料變動慢、付費意願高」的垂直領域(盡職調查、工程情報、研究情報),而非所有 RAG 場景的通用替代品。
AI視野
Cover

OpenAI做了块小键盘,包揽了人类能做的最重要的事情!

"當 AI 從「回答問題」升級到「動手做事」,人類的工作從寫提示詞,變成在批准鍵前慢十秒。"
Top 5 Insights
  • **介面轉向**:Codex Micro 的硬體化,是 AI 工作從「對話框」走向「控制台」的訊號——當 AI 輸出帶副作用,狀態可視與實體批准就成為必要,人身分從「提問者」轉為「Agent 值班經理」。
  • **瓶頸轉移**:Agent 時代的瓶頸不在 AI 聰不聰明,而在「批准」這個人類動作——它被壓成一次按鍵,使判斷容易退化成反射(vigilance decrement)。
  • **完成感 ≠ 正確性**:`exit code == 0` 只代表命令跑完,不代表功能正確;AI 報告的流暢度,不等於證據的充分性——這是批准失誤的技術根因。
  • **5 問 + 3 色**:把批准從直覺升級成流程——5 問(改了什麼/憑什麼說對/影響多大/能否撤回/誰負責)配 3 色(綠快速/黃抽查/紅人工),依風險量級差異化確認強度。
  • **不可外包的最後一厘米**:AI 接走執行,接不走後果與責任;省下的時間裡,永遠要留十秒給判斷——這是 Agent 時代人類最該訓練的能力。
Agent架構
Cover

From Loop Engineering to Graph Engineering?(從迴圈工程到圖工程?)

"單迴圈死於 Goodhart;多迴圈的「圖」解決了形狀問題卻仍可能循環空轉;唯有錨(凍結量度+凍結規則+外部價值判斷)能讓改善機制真正碰到現實。恆久的軸不是 loops vs graphs,而是 ungrounded vs grounded。"
Top 5 Insights
  • **單迴圈是「變好的 hello world」,但它的形狀內含四種結構性失敗**:Goodhart(指標被遊戲化)、向上盲(不能質疑參考值)、衝突(獨立迴圈互打)、量度衰變(無人監看監看者)。這些不是 bug,是單迴圈拓樸的必然後果。
  • **解法不是更好的迴圈,而是迴圈的圖(graph of loops)**——而且四失敗有四個一對一的拓樸解:配對、層級、仲裁、稽核。**「可靠性住在邊裡」**:誰餵誰、誰監看誰、誰能否決誰,才是設計單位。
  • **但圖本身有極限**:若每個迴圈都消費 reports 而沒有人碰到地面,圖會退化成「循環互證」——什麼都一致、什麼都沒驗證,比單迴圈更晚更貴地失敗。**拓樸買到精緻,沒買到現實。**
  • **真正的補丁是「錨」**:錨定量度(錢進銀行、測試真的跑過)、凍結節點(優化器永不可調,如 held-out set)、以及來自圖外的「更好」之根判斷(由人透過真實失敗提供)。最成熟的架構會**誠實標記自己權威的邊界**。
  • **恆久的對立軸是 ungrounded vs grounded,不是 loops vs graphs**——無論改善機械是什麼形狀,關鍵是它是否持續碰觸現實、監看者是否真獨立、凍結規則是否抗壓、是否承認最深目標是被選擇而非被計算的。**作者唯一的遺憾是用了 "graph" 這個詞**,因為它把一個更細糞的現象(錨與接地)誤導成純拓樸問題。
其他
Cover

評 Kimi K3:小鎮青年暴打資本家

"Kimi K3 以 2.8T 超大尺寸主動放棄經濟性,再用開源權重把「模型稅」歸零,把算力封鎖劣勢反轉為動搖美國閉源前沿實驗室壟斷租金的不對稱武器。"
Top 5 Insights
  • **K3 是戰略轉向,不是版本升級**:K2.5~K2.7 在 1T/A32B 底盤上靠後訓練壓榨多代;K3 直接把總參數推到 2.8T、激活約 50B,回到預訓練規模擴張,並抽換回本家技術棧,標誌 Kimi 主動結束「既有基座後訓練」階段,重新爭奪前沿尺寸話語權。
  • **「放棄經濟性」本身就是入場券**:64 卡部署與 $3/$15 定價意味著 K3 不為 adoption 而戰,而是用「不計成本做最大」換取進入最高能力組(官方:僅落後 Sol/Fable)的資格,這是它一切外溢效應的前提。
  • **開源權重把地緣劣勢武器化**:算力管制剝奪了中國的超額利潤空間,反而促成「不要利潤、做開源」的反轉,形成「中國模型 + 美國/全球推理集群 VS 美國閉源前沿實驗室」的不對稱組合,使華盛頓自己陷入制裁/放開/折中的不可能三角。
  • **「取消模型稅」反向衝擊 AI CapEx**:當多家平台可部署同一份權重,推理定價從「閉源上游想收多少」回歸「高效集群跑成功任務的成本」,下游毛利系統性下降長期將壓縮上游 GPU 的議價彈性——短期 NVDA 議價權不變,但回報曲線的折現假設需下修。
  • **方法論結晶是 Too Big to Fail**:強大模型可稀疏化、量化、蒸餾下沉並擔任教師,但缺乏能力的小模型難靠延長思考補出來;這個不對稱性使「往大了做」成為粗糙但有效的前沿路線,OpenAI o1 做小→依賴 test-time compute→GPT-5.6 Sol 重新做大尺寸,本身已是路線回歸的承認。
學習資源
Cover

skill+anki+美剧,这样学英语太高效了(开源这个skill)

"把「不需要人判斷的執行」全交給 agent,把「情境識別」留給劇集,再把順序倒過來(先卡後劇),就是 10 倍效率。"
Top 5 Insights
  • **方法論核心是「順序顛倒」,不是工具**。整篇文章真正值錢的洞察是「先卡片後劇集」——把識別(recognition)當成第一次複習,讓短期記憶在真實情境裡被鞏固成長期記憶。工具(skill / Anki / FSRS)只是把這個順序變得可執行。把這個原則抽走,整條流水線就退化成普通的單詞 app。
  • **「辨識可自動化步驟」是架構師級別的判斷**。作者從 5 步手動流程裡正確分離出「全是執行、無一步需要判斷」這個屬性,並把判斷(取捨哪些詞、用哪個字幕源、怎麼排優先級)寫死成 skill 的 policy,把執行交給 agent。這與軟體工程裡把 business logic 與機械執行分層是同一種思維。
  • **用機制消滅易錤點,優於靠人小心**。CSV 文件頭自帶 Anki 導入指令(分隔符、牌組名、字段映射),把「正反面搞反」這個高頻人為錯誤從機制上消滅。卡片方向(正面英文原句、背面中文譯句)也對齊真實使用場景(聽到英文→反應意思)。這是 API/介面設計「防止誤用」的範例。
  • **科學理論是骨架,但被過度簡化為單一銀彈**。遺忘曲線、情境編碼、Krashen i+1、FSRS 各自有適用條件與爭論,作者只取結論支撐流程,沒有交代失效邊界。讀者若把這些理論當成已證成的真理而非啟發式,會高估方法的普適性。
  • **明確的適用邊界與風險**:本方法假設用戶已有 B1 以上英文基礎(skill 跳過基礎詞、只取 B2-C1)、假設字幕來源穩定(subslikescript 繞 JS 驗證碼屬灰色地帶)、假設每天能看一集(FSRS 在 0.90 保留率下,500–1000 張卡的每日複習量長期可能造成「複習雪崩」)。零基礎者、無穩定看劇習慣者、字幕缺失的冷門劇,都不在本方法的適用範圍內。