AI工具 領域
AI工具 總結報告
本日 AI工具 領域聚焦於 OpenAI 新版 ChatGPT 的產品結構重組——伴隨 GPT-5.6 模型發布,OpenAI 把原本獨立的 Codex 應用併入 ChatGPT,介面因此出現 Chat/Work/Codex 三個可切換模式,原本的聊天框被弱化成 Quick chat 小入口。這次重組的本質,是把同一個底層 LLM 依「交付深度」切出三個市場:Chat 交付答案、Work 交付可用品(文件/表格/簡報/網頁)、Codex 交付程式碼變更。最具啟示性的產品洞察是「資料驅動命名」——Codex 原本給程式設計師、每週 500 萬人用,其中超過 100 萬人根本不寫程式、只做辦公雜活,OpenAI 於是把這個「既成事實」正式化為 Work 模式。這篇指南對一般使用者的核心收斂是:多數人用 Chat 即可,要交付成品才用 Work,寫程式才用 Codex;而 Work 與 Codex 共用同一個「智能體額度」池會互相擠占,是最容易踩的實務坑。
核心主題 (Key Themes)
三模式本質是「交付深度」的三段化 :OpenAI 用三個入口,把同一個底層 LLM 依使用者要什麼程度的交付,切出三個市場,是「同一能力、場景化包裝」的教科書案例。產品命名落後於真實使用行為——「把既成事實正式化」 :Work 的誕生來自真實使用資料,而非事先規劃,示範了「產品命名往往滯後於使用者實際怎麼用」。額度池設計是隱形的升級牽引+跨端不互通是當前最大摩擦 :同訂閱下,Chat 與(Work+Codex)分用兩個額度池,且 Work 與 Codex 共用會互相擠占——這個機制自然把「重度組合使用者」推向 Plus/Pro。
閱讀報告全文
# 領域總結:AI工具 (2026-07-13)
## 總結概述
本日 AI工具 領域聚焦於 OpenAI 新版 ChatGPT 的產品結構重組——伴隨 GPT-5.6 模型發布,OpenAI 把原本獨立的 Codex 應用併入 ChatGPT,介面因此出現 Chat/Work/Codex 三個可切換模式,原本的聊天框被弱化成 Quick chat 小入口。這次重組的本質,是把同一個底層 LLM 依「交付深度」切出三個市場:Chat 交付答案、Work 交付可用品(文件/表格/簡報/網頁)、Codex 交付程式碼變更。最具啟示性的產品洞察是「資料驅動命名」——Codex 原本給程式設計師、每週 500 萬人用,其中超過 100 萬人根本不寫程式、只做辦公雜活,OpenAI 於是把這個「既成事實」正式化為 Work 模式。這篇指南對一般使用者的核心收斂是:多數人用 Chat 即可,要交付成品才用 Work,寫程式才用 Codex;而 Work 與 Codex 共用同一個「智能體額度」池會互相擠占,是最容易踩的實務坑。
## 核心洞察與共同趨勢
### 1. 三模式本質是「交付深度」的三段化
OpenAI 用三個入口,把同一個底層 LLM 依使用者要什麼程度的交付,切出三個市場,是「同一能力、場景化包裝」的教科書案例。
* **Chat(設計師)**:一問一答,給建議,動嘴不動手,快進快出;全端可用(網頁/手機/桌面)。
* **Work(裝修隊長)**:交鑰匙成品——可接 Slack/信箱/雲端/CRM,可定時在背景跑;網頁+手機已上線,桌面版最強(讀本地檔+內建瀏覽器)。
* **Codex(水電工)**:讀程式碼、交程式碼變更、跑測試;僅桌面端,手機只能遠端看進度。
### 2. 產品命名落後於真實使用行為——「把既成事實正式化」
Work 的誕生來自真實使用資料,而非事先規劃,示範了「產品命名往往滯後於使用者實際怎麼用」。
* **關鍵數字**:Codex 每週 500 萬使用者中,超過 100 萬人不寫程式、只做辦公雜活——OpenAI 據此把這部分需求正式化為 Work(連辦公軟體、輸出文件與簡報而非程式碼)。
* **真實案例佐證 Work 能力**:Zapier 行銷團隊每月自動審查數千條潛在客戶線索、追蹤互動、生成高階週報;維珍航空用 Work 做競品分析,把數週的活縮短到幾小時。
### 3. 額度池設計是隱形的升級牽引+跨端不互通是當前最大摩擦
同訂閱下,Chat 與(Work+Codex)分用兩個額度池,且 Work 與 Codex 共用會互相擠占——這個機制自然把「重度組合使用者」推向 Plus/Pro。
* **額度擠占實務坑**:白天用 Work 跑複雜任務把額度耗得差不多,晚上想用 Codex 可能就不夠;規劃用量時應把 Work 與 Codex 當同一個預算控管。
* **跨端割裂**:網頁 Work 與桌面 Work 目前不互通(雲端歸雲端、本地歸本地);舊桌面端改名 ChatGPT Classic、不再更新——重度依賴舊版者面臨遷移成本。
## 行動建議與實踐指南
1. **用「交付深度」自檢日常任務**:盤點哪些任務其實「要的是成品、卻一直在用 Chat 拿文字再自己後製」——這些就是改用 Work 能立刻省時間的候選。
2. **設好 Work 連接外部工具時的授權範圍**:Work「定時在背景跑、自動連信箱與 Slack」衍生隱私與授權風險;務必畫清「停下來問我」的邊界,別讓它自動讀取不願曝光的資料。
3. **把 Work 與 Codex 當同一個額度預算控管**:因兩者共用智能體額度會互相擠占,重度使用者應在升級 Plus/Pro 前先估算組合用量。
4. **先定「在哪個端做完」再開工**:跨端不互通是當前最大摩擦,避免做到一半換端就斷掉;寫程式任務直接鎖定桌面端。
Obsidian 開啟
AI工程 領域
AI工程 總結報告
本日 AI工程 領域由知名開發者 @theo 的實戰避坑指南撐起——他自述已用 gpt-5.6-sol 燒掉超過 20 萬美元 token,把在 200 美元 Codex Pro 訂閱上「太容易撞到上限」的痛點,整理成一份可立刻執行的建議。這篇文章的工程價值不在「介紹功能」,而在點破一個結構性張力:**GPT-5.6 相比 5.5「會一直跑下去」——可靠度提升的代價,是單則訊息耗額度量級暴增、token 消耗更難預測**。作者給出量化對比:5.5 單則訊息約用 0.1%~2% 額度,5.6 可達 15%,疊加 fast mode 的 2.5 倍乘數等於單則訊息吃掉 5 小時窗口的 40%。這個「更強的自主性=更難預測的成本」並非 GPT-5.6 獨有,而是所有會自主 multi-step、會 spawn subagent 的 agent 系統(Claude Code、Cursor、Devin)的共同課題。須特別注意本文的時效性——多數「避開」建議(Ultra、fast mode、subagent 行為)綁定 Codex harness 當下的 bug,作者明說「等 bug 修了再回來」,應視為 2026-07 的權變措施。
核心主題 (Key Themes)
結構性張力:autonomy 提升 ↔ cost predictability 下降 :這是全文的工程洞見核心,也是所有自主 agent 系統的通則。5.6 把「會停下來要鼓勵」的 5.5,變成「會一直跑到底」的可靠 agent,但可靠度的紅利是用「不可預測的 token 帳單」換來的。subagent fan-out 是隱形的成本放大器 :作者點出一個具體、可驗證的機制gpt-5.6-sol 永遠以與父實例相同的模型與推理等級 spawn subagent,這正是 Ultra 目前「壞掉」的原因——一次 spawn 等於一次等級不降的完整複製。「跑不停」需要顯式停止點當成本煞車 :5.6 會「一直、一直、一直做下去」,有時跑得太遠——這與 Prompt工程 領域的 autonomy policy 宣告同源用 prompt 裡的停止點,把跑不停的模型重新納入可控成本。
閱讀報告全文
# 領域總結:AI工程 (2026-07-13)
## 總結概述
本日 AI工程 領域由知名開發者 @theo 的實戰避坑指南撐起——他自述已用 gpt-5.6-sol 燒掉超過 20 萬美元 token,把在 200 美元 Codex Pro 訂閱上「太容易撞到上限」的痛點,整理成一份可立刻執行的建議。這篇文章的工程價值不在「介紹功能」,而在點破一個結構性張力:**GPT-5.6 相比 5.5「會一直跑下去」——可靠度提升的代價,是單則訊息耗額度量級暴增、token 消耗更難預測**。作者給出量化對比:5.5 單則訊息約用 0.1%~2% 額度,5.6 可達 15%,疊加 fast mode 的 2.5 倍乘數等於單則訊息吃掉 5 小時窗口的 40%。這個「更強的自主性=更難預測的成本」並非 GPT-5.6 獨有,而是所有會自主 multi-step、會 spawn subagent 的 agent 系統(Claude Code、Cursor、Devin)的共同課題。須特別注意本文的時效性——多數「避開」建議(Ultra、fast mode、subagent 行為)綁定 Codex harness 當下的 bug,作者明說「等 bug 修了再回來」,應視為 2026-07 的權變措施。
## 核心洞察與共同趨勢
### 1. 結構性張力:autonomy 提升 ↔ cost predictability 下降
這是全文的工程洞見核心,也是所有自主 agent 系統的通則。5.6 把「會停下來要鼓勵」的 5.5,變成「會一直跑到底」的可靠 agent,但可靠度的紅利是用「不可預測的 token 帳單」換來的。
* **量化對比**:5.5 單則 0.1%~2%(fast 約 5% 峰值)→ 5.6 單則可達 15%(fast → 40%)。
* **深層機制**:模型越能自主 end-to-end 完成,每次決策與工具呼叫的累計成本越難事先估算——這是 agent 相對於傳統「單次推論」的根本成本結構差異。
### 2. subagent fan-out 是隱形的成本放大器
作者點出一個具體、可驗證的機制:gpt-5.6-sol **永遠**以與父實例相同的模型與推理等級 spawn subagent,這正是 Ultra 目前「壞掉」的原因——一次 spawn 等於一次等級不降的完整複製。
* **三條防護**:降低推理等級(subagent 配 high 不算太糟,low/medium 也很棒);更新全域 AGENTS.md 加「only spawn subagents when I ask you to」抑制過度 eager 的生成;必要時啟用 `hide_spawn_agent_metadata = false` 旗標。
* **對其他 agent 的啟示**:任何「父 agent 派發子 agent」的架構,都必須考慮子任務的成本放大效應——否則一次 fan-out 可能瞬間吃光預算。
### 3. 「跑不停」需要顯式停止點當成本煞車
5.6 會「一直、一直、一直做下去」,有時跑得太遠——這與 Prompt工程 領域的 autonomy policy 宣告同源:用 prompt 裡的停止點,把跑不停的模型重新納入可控成本。
* **停止點範例**:「先寫計畫,完成後停下來問我回饋再繼續」「放 PR、babysit 第一輪審查意見並處理,第一輪處理完後停下,後面我來接手」。
* **本日跨領域呼應**:與 [[GPT-5.6 提示詞大師課]] 的四要素 Autonomy policy、[[GPT-5.6 Prompt 到底該怎麼寫]] 的 Checkpoint 完全同源——停止條件的顯式宣告,是 agent 時代 prompt 的標準配備。
## 行動建議與實踐指南
1. **暫時避開兩個「加倍器」**:fast mode 的 2.5x 乘數與 Ultra 的 bug 性爆量,是當下最容易在單則訊息內燒掉 40% 額度的開關;在 OpenAI 修 bug 前,預設關閉它們是最務實選擇(注意:此建議有強保存期限)。
2. **為 agent 工作流加兩道保險**:(a) 在 prompt 寫死「做到 X 就停、等我回應」的檢查點;(b) 用用量監控工具(dashboards、ccusage、codexbar)建立對「單則訊息花多少」的直覺,而非等撞上限才發現。
3. **模型選擇務實化**:$200 檔 → sol high;其他 → sol low;Terra 適合快速審查或極大化用量——以實測為準,不迷信「貴的比較好」。
4. **把本文建議當「權變措施」而非穩定知識**:多數避開建議綁定 Codex harness 當下 bug 與 5.6 早期行為,隨版本更新應重新驗證;進階使用者可考慮「讓 Fable 當駕駛、spawn Codex subagent」的多訂閱編排策略。
Obsidian 開啟
AI視野 領域
AI視野 總結報告
本日 AI視野 領域僅一篇文章,但分量極重——微軟 CEO Satya Nadella 提出「反向資訊悖論(Reverse Information Paradox)」,把諾貝爾經濟學家 Kenneth Arrow 的古典資訊悖論在 AI 時代做了鏡像翻轉。Arrow 的版本裡,風險承擔者是「賣方」(為了賣知識得先展示,展示即送出);Nadella 指出,在 AI 時代風險翻轉到「買方」——企業為了讓模型表現更好,被迫餵入專屬知識,而這些 corrections、evals、traces 會單向流向模型供應商。這不是一次性外洩,而是「trace by trace、correction by correction、eval by eval」的持續滲透。Nadella 的核心主張是:雲端時代企業累積「資料」,AI 時代企業累積「學習」,因此護城河命題必須從「保護資料」升級為「保護學習機制」,並以 5C(Control/Capability/Choice/Cost/Compound)作為企業層級的架構對策。閱讀時須留意作者雙重身分——他既是警示者,本身也是「學習基礎設施擁有者」。
核心主題 (Key Themes)
洩漏方向翻轉:從賣方風險到買方風險 :Arrow 悖論與反向悖論構成對稱翻轉,是全文論證支點。AI 改變的不是「會不會洩漏」,而是「誰承擔洩漏風險」。學習單向流動 → 價值向基礎設施擁有者收斂 :模型供應商主張對公開資料的公平使用權(訓練),卻對客戶的「蒸餾」設限、並保留向使用行為學習的權利——這個不對稱使經濟價值收斂到「學習基礎設施擁有者」而非「知識創造者」。企業對策:trust boundary + 5C :企業需要一道「硬邊界」,讓 human capital 與 token capital 複利累積,未經同意連 intelligence exhaust 都不能跨越。
閱讀報告全文
# 領域總結:AI視野 (2026-07-13)
## 總結概述
本日 AI視野 領域僅一篇文章,但分量極重——微軟 CEO Satya Nadella 提出「反向資訊悖論(Reverse Information Paradox)」,把諾貝爾經濟學家 Kenneth Arrow 的古典資訊悖論在 AI 時代做了鏡像翻轉。Arrow 的版本裡,風險承擔者是「賣方」(為了賣知識得先展示,展示即送出);Nadella 指出,在 AI 時代風險翻轉到「買方」——企業為了讓模型表現更好,被迫餵入專屬知識,而這些 corrections、evals、traces 會單向流向模型供應商。這不是一次性外洩,而是「trace by trace、correction by correction、eval by eval」的持續滲透。Nadella 的核心主張是:雲端時代企業累積「資料」,AI 時代企業累積「學習」,因此護城河命題必須從「保護資料」升級為「保護學習機制」,並以 5C(Control/Capability/Choice/Cost/Compound)作為企業層級的架構對策。閱讀時須留意作者雙重身分——他既是警示者,本身也是「學習基礎設施擁有者」。
## 核心洞察與共同趨勢
### 1. 洩漏方向翻轉:從賣方風險到買方風險
Arrow 悖論與反向悖論構成對稱翻轉,是全文論證支點。AI 改變的不是「會不會洩漏」,而是「誰承擔洩漏風險」。
* **Arrow 古典版**:賣方為賣知識須先展示,展示即送出價值;專利制度正是為解此一面而生。
* **AI 反向版**:買方為用得強須餵專屬知識,且「想讓模型越好,就必須餵越多」——雙重付費(金錢+更珍貴的專屬知識)。
### 2. 學習單向流動 → 價值向基礎設施擁有者收斂
模型供應商主張對公開資料的公平使用權(訓練),卻對客戶的「蒸餾」設限、並保留向使用行為學習的權利——這個不對稱使經濟價值收斂到「學習基礎設施擁有者」而非「知識創造者」。
* **洩漏載體**:prompts、agent 使用的 tools、尤其是模型出錯時的 corrections——後者被蒸餾成「競爭對手買不到、卻會一點一滴滲漏」的機構知識。
* **客戶端語言佐證**:Palantir 的 Alex Karp——「技術客戶要的是對 compute、models、data stack 與他們 alpha 的控制權……要確知自己擁有生產工具,而非被轉移給別人。」
### 3. 企業對策:trust boundary + 5C
企業需要一道「硬邊界」,讓 human capital 與 token capital 複利累積,未經同意連 intelligence exhaust 都不能跨越。
* **Control**:私有 evals 定義「什麼叫做好」;自持記憶、traces、回饋、決策、機構情境。
* **Choice**:編排層(orchestration)必須與單一模型解耦——驗證標準只有一個:「拔掉任一模型,你還能跑嗎?」
* **Capability/Cost/Compound**:租戶內自訓/微調、跨模型最佳成本組合、四者合一形成「爬山機(hill climbing machine)」持續學習迴圈。
## 行動建議與實踐指南
1. **盤點「會餵給外部模型」的高價值知識清單**:列出客戶資料、內部決策邏輯、對模型錯誤的修正記錄,標註哪些是不可逆外流的機構知識,作為後續治理優先序。
2. **為關鍵工作流建立私有 evals**:evals 不只是測試工具,而是組織「什麼叫做好」的定義權——誰擁有 evals,誰就擁有對齊(alignment)主導權。
3. **把編排層與單一模型解耦**:任何把商業邏輯綁死在單一模型上的架構,等於把「veteran capability」外包給別人;設計時即假設「任一模型可能被抽走」。
4. **對「分散式學習能否追得上集中式大模型」保持務實懷疑**:Nadella 主張「把 learning infrastructure 分散到每家企業」高度契合混合雲廠商利益,企業應將 5C 視為合理自保架構,但對小廠自訓模型品質保留驗證空間。
Obsidian 開啟
Prompt工程 領域
Prompt工程 總結報告
本日 Prompt工程 領域三篇文章同源、兩兩互補——皆源自 OpenAI 官方《GPT-5.6 Model Guidance》(developers.openai.com/api/docs/guides/latest-model),形成「英文正典+中文譯本+中文重組」的三聯資產。@aiedge_(英文白話轉譯)與 @ai_suxiaole(簡中譯本)是翻譯對,技術內容一致、語言受眾不同;@RealCodedAlpha 則是不同作者的中文原創重組,提出 CROCC 框架。三篇共同傳遞一個反直覺的核心命題:**對 GPT-5.6,prompt 工程要從「加法」變成「減法」**——模型已能自行判斷目標與所需工作量,舊式「先給角色、再規定分析/計畫/反思、最後叮嚀深入思考」的隆重寫法,從「有幫助」變成「可能有害」。OpenAI 內部 Coding Agent 評測給出硬證據:刪除重複指令、無效範例、冗長工具說明後,Eval 分數 +10%~15%、總 token −41%~66%、成本 −33%~67%。落地框架上,@aiedge_/@ai_suxiaole 給四要素(Outcome/Constraints/Evidence/Autonomy),@RealCodedAlpha 給中文版 CROCC(Context/Request/Output Format/Constraints/Checkpoint)——後者本質是前者的中文重組。三者構成 GPT-5.6 提示詞的完整實作圖譜,可依語言偏好與框架風格擇一為主、其餘為輔。
核心主題 (Key Themes)
共同主軸:從「教模型怎麼想」轉向「告訴模型要什麼」 :三篇文章的核心論點完全一致——GPT-5.6 更懂意圖,prompt 重心應從「過程控制」轉向「結果定義+邊界+停止條件」。共同的「做減法」清單:舊 prompt 最該刪五類 :三篇都點出同樣的刪減標的,互為佐證——這五類是 GPT-5.6 時代 prompt 的「冗餘重災區」。三套落地框架的對照與互補(本日最值得收藏的實體) :同一份官方指南,被重組成可直接套用的框架——理解它們的對應關係,等於掌握 GPT-5.6 prompt 的完整骨架。配套的三軸決策:模型 × 推理 × Pro Mode :三篇對 GPT-5.6 的模型與推理選擇建議一致,可合併為一份決策表。
閱讀報告全文
# 領域總結:Prompt工程 (2026-07-13)
## 總結概述
本日 Prompt工程 領域三篇文章同源、兩兩互補——皆源自 OpenAI 官方《GPT-5.6 Model Guidance》(developers.openai.com/api/docs/guides/latest-model),形成「英文正典+中文譯本+中文重組」的三聯資產。@aiedge_(英文白話轉譯)與 @ai_suxiaole(簡中譯本)是翻譯對,技術內容一致、語言受眾不同;@RealCodedAlpha 則是不同作者的中文原創重組,提出 CROCC 框架。三篇共同傳遞一個反直覺的核心命題:**對 GPT-5.6,prompt 工程要從「加法」變成「減法」**——模型已能自行判斷目標與所需工作量,舊式「先給角色、再規定分析/計畫/反思、最後叮嚀深入思考」的隆重寫法,從「有幫助」變成「可能有害」。OpenAI 內部 Coding Agent 評測給出硬證據:刪除重複指令、無效範例、冗長工具說明後,Eval 分數 +10%~15%、總 token −41%~66%、成本 −33%~67%。落地框架上,@aiedge_/@ai_suxiaole 給四要素(Outcome/Constraints/Evidence/Autonomy),@RealCodedAlpha 給中文版 CROCC(Context/Request/Output Format/Constraints/Checkpoint)——後者本質是前者的中文重組。三者構成 GPT-5.6 提示詞的完整實作圖譜,可依語言偏好與框架風格擇一為主、其餘為輔。
## 核心洞察與共同趨勢
### 1. 共同主軸:從「教模型怎麼想」轉向「告訴模型要什麼」
三篇文章的核心論點完全一致——GPT-5.6 更懂意圖,prompt 重心應從「過程控制」轉向「結果定義+邊界+停止條件」。
* **@aiedge_(英)與 @ai_suxiaole(中譯)的證據**:OpenAI 內部評測,精簡提示 vs 冗長系統提示,評分 +15%、token −60%;「重複寫先詢問/不得修改/等待批准」反而觸發不必要的權限檢查。
* **@RealCodedAlpha 的區間數字**:Eval +10%~15%、token −41%~66%、成本 −33%~67%——給範圍比單點更保守,並強調「每次只改一類內容,才知道哪項調整帶來改善」的科學化刪減法。
### 2. 共同的「做減法」清單:舊 prompt 最該刪五類
三篇都點出同樣的刪減標的,互為佐證——這五類是 GPT-5.6 時代 prompt 的「冗餘重災區」。
* **無法驗證的形容詞**(「深入、全面、嚴謹」——模型只能猜)/**重複出現的規則**(寫兩遍不會更安全,反觸發停頓詢問)/**不必要的思考流程**(三輪反思、五位專家模擬)/**無實際作用的專家角色**/**過多工具暴露**(二十個工具全給,模型選擇成本與上下文消耗雙升)。
### 3. 三套落地框架的對照與互補(本日最值得收藏的實體)
同一份官方指南,被重組成可直接套用的框架——理解它們的對應關係,等於掌握 GPT-5.6 prompt 的完整骨架。
* **@aiedge_/@ai_suxiaole 四要素(英+中譯)**:Outcome(完成長什麼樣)/Constraints(審批邊界、不可碰、範圍)/Evidence-success criteria(證據/格式)/Autonomy policy(不必先問可做哪些)。附一段「回答類 vs 變更類」授權分句的 prompt 原文(中英對照)。
* **@RealCodedAlpha CROCC(本文自訂詞)**:Context(會改變結果的背景)/Request(目標+任務+完成標準)/Output Format(交付方式)/Constraints(來源/範圍/權限/禁止)/Checkpoint(續 vs 停的條件)。附一份完整的財報分析 prompt 範本,與「依任務複雜度分四檔」的長度指南。
* **對應關係**:CROCC 本質是四要素的中文重組——把 Outcome 拆成 Context+Request、把 Autonomy 細化為 Checkpoint、補上 Output Format。
### 4. 配套的三軸決策:模型 × 推理 × Pro Mode
三篇對 GPT-5.6 的模型與推理選擇建議一致,可合併為一份決策表。
* **模型**:Sol(最強最貴/困難任務)/Terra(日常預設)/Luna(最快最便宜/高吞吐)——「模型越強不代表越適合所有任務」,Luna 能穩定做的就別上 Sol。
* **推理六檔**:none/low/medium(預設起點)/high/xhigh/max(最後手段)。
* **Pro Mode**:獨立於推理強度,只在邊際品質提升實際影響結果時開;用同一批真實任務做 Standard vs Pro 對照。
## 行動建議與實踐指南
1. **對最長的那支系統 prompt 做「科學化刪減實驗」**:刪一類重複規則→跑測試→刪無效範例→再跑→縮短工具說明→再比對,每次只改一類,找出真正有貢獻的部分(@RealCodedAlpha 的方法論)。
2. **建立「prompt 自檢五問」習慣**:寫完任何 prompt,逐一打勾——模型知道我要什麼嗎/知道怎樣算完成嗎/知道哪些資訊不能猜嗎/知道哪些操作不能越界嗎/知道什麼時候該停嗎;五問都能答,prompt 通常就夠用。
3. **用「四要素」或「CROCC」任選一套做範本,按任務複雜度伸縮**:簡單任務(R+O)/普通(C+R+O)/複雜研究(全框架)/Agent(再補工具+權限+驗證命令+重試上限);CROCC 一詞為作者自訂,引用時宜標明非 OpenAI 官方命名。
4. **依語言偏好建立雙語對照資產**:英文正典(@aiedge_)與中文譯本(@ai_suxiaole)構成翻譯對,技術內容一致——中文讀者可擇一為主、另一為輔,再搭配 @RealCodedAlpha 的 CROCC 中文重組,即有完整的 GPT-5.6 提示詞中英資產。
5. **高合規場域保留詳盡邊界聲明**:醫療、金融、法律等高風險場域,「短提示」不能無條件套用——模型懂上下文不等於可以省略合規必要的來源、範圍、權限要求。
Obsidian 開啟
AI工具
新版 ChatGPT:Chat、Work、Codex,小白要知道的幾件事
"新版 ChatGPT 把「聊天」弱化成一個小入口,新增 Work(辦公成品)與 Codex(程式碼)——多數人用 Chat 就夠,真要它把活做完才輪到 Work/Codex。"
Top 5 Insights
**核心洞見 1:三模式本質是「交付深度」的三段化**。Chat 交付答案、Work 交付可用品、Codex 交付程式碼變更——OpenAI 用三個入口,把同一個底層 LLM 依「使用者要什麼程度的交付」切出三個市場,這是「同一能力、場景化包裝」的教科書案例。 **核心洞見 2:Work 的誕生來自真實使用資料**。「500 萬 Codex 使用者中,超過 100 萬人不寫程式、只做辦公雜活」——這個數字直接催生了 Work。產品命名往往是落後於真實使用行為的,OpenAI 這次是「把既成事實正式化」。 **架構建議 3:額度池設計是隱形的升級牽引**。Chat 與(Work+Codex)分用兩個池,且 Work 與 Codex 共用會互相擠占——這個機制會自然把「重度組合使用者」推向 Plus/Pro。實務上規劃用量時,要把 Work 與 Codex 當作同一個預算來控管。 **架構建議 4:跨端不互通是當前最大摩擦**。網頁 Work 與桌面 Work 不互通、Codex 僅桌面端——選擇工作流時要把「在哪個端做完」先定下來,避免做到一半發現換端就斷掉。 **決策建議 5:選擇可以極度簡化**。多數人→Chat;要交付成品→Work;寫程式→Codex;模型預設→Terra。把這四條當預設值,只有在任務明確超出時才偏離,能省下絕大多數決策成本。
閱讀全文
---
tags: [AI工具, ChatGPT, GPT-5.6, 產品設計, 產業趨勢]
date: 2026-07-13
read: false
source: "2026-07-13T095927+0800-新版 ChatGPT:Chat、Work、Codex,小白要知道的几件事.md"
original_title: "新版 ChatGPT:Chat、Work、Codex,小白要知道的几件事"
---
# 新版 ChatGPT:Chat、Work、Codex,小白要知道的幾件事

原始來源與檔名:2026-07-13T095927+0800-新版 ChatGPT:Chat、Work、Codex,小白要知道的几件事.md
---
## SOURCE | 資訊源評估
- **準確性**:中 — 作者(愛學習的 Niko,17 年工程師)以小白視角轉述 OpenAI 新版 ChatGPT 的產品變化,多為作者個人理解與比喻,未逐項附官方出處;產品細節(如 Work/Codex 額度共用、端點可用性)可能隨版本快速變動,須以官方說明為準。
- **易理解性**:高 — 大量使用「裝修房子:設計師/裝修隊長/水電工」的生活化比喻,刻意降低技術門檻,適合非技術讀者快速建立心智模型。
- **閱讀策略建議**:把「Chat 回答問題、Work 幫你幹活、Codex 幫你寫程式」這句當記憶樁;對收費與額度細節(Work 與 Codex 共用「智能體額度」、會互相擠占)要特別留意,這是實際使用最容易踩坑之處;GPT-5.6 三型號 Sol/Terra/Luna 的選擇,記住「預設 Terra 即可」即可。
## NAPKIN | 餐巾紙
### 餐巾紙公式
> Chat=動嘴 / Work=交成品 / Codex=做專業活
_OpenAI 把原本單一的聊天框,拆成三種「交付深度」:回答(Chat)、交付可用品(Work)、交付程式碼變更(Codex),背後是同一套底層技術的兩個場景化入口。_
### 一句話
> 新版 ChatGPT 把「聊天」弱化成一個小入口,新增 Work(辦公成品)與 Codex(程式碼)——多數人用 Chat 就夠,真要它把活做完才輪到 Work/Codex。
### 餐巾紙草圖
```
┌──────────────────────────────────────────────
│ 新版 ChatGPT 三模式(交付深度遞增)
│
│ Chat Work Codex
│ ┌──── ┌──── ┌────
│ │ 設計師 │ 裝修隊長 │ 水電工
│ │ 給建議 │ 交成品 │ 做專業活
│ │ 一問一答 │ 文件/表格 │ 程式碼變更
│ └──── │ /簡報/網頁 │ 跑測試
│ └──── └────
│ 讀:問題 讀:業務資料 讀:程式碼
│ 交:答案 交:商務成品 交:程式變更
│
│ 同一訂閱 ─┬─ Chat 額度(聊天池)
│ └─ 智能體額度(Work + Codex 共用,會互相擠占)
└──────────────────────────────────────────────
```
## ROUND 1: SKELETON | 骨架掃描
**「這篇文章在說什麼」**
- **核心問題**:新版 ChatGPT 介面多了 Chat/Work/Codex 三個模式,一般人到底該用哪一個?
- **核心答案**:記住一句話——「Chat 回答問題,Work 幫你幹活,Codex 幫你寫程式」;多數人日常用 Chat 即可,需要 AI 把活做完(做成品)才用 Work,寫程式才用 Codex;三者共用同一訂閱,但 Work 與 Codex 共用「智能體額度」會互相擠占。
- **論證結構**:案例+對比型。先用一句口訣定錨,再用「裝修房子」比喻把三模式差異具象化,接著逐一展開 Work 能力、與 Codex 差異、端點可用性、收費額度、GPT-5.6 三型號選擇。
### 章節骨架
1. **背景**:GPT-5.6 發布+Codex 併入 ChatGPT
2. **三模式區分**:Chat/Work/Codex 一句話
3. **Work 能力**:接工具、交成品、定時跑
4. **Work vs Codex**:同技術、讀不同、交不同
5. **端點可用性**:網頁/手機/桌面差異
6. **訂閱額度**:聊天池 vs 智能體池
7. **GPT-5.6 三型號**:Sol/Terra/Luna
8. **結論**:預設 Terra,多數人用 Chat
## ROUND 2: DISSECTION | 血肉解剖
**「憑什麼這麼說」**
### 論證鏈
```
OpenAI 發布 GPT-5.6 + 把 Codex 併入 ChatGPT
▼
介面出現 Chat / Work / Codex 三模式
▼
三者本質差異在「交付深度」:建議 / 成品 / 專業活
▼
Work 與 Codex 底層同一技術,差在「讀什麼、交什麼」
▼
同訂閱下,Chat 與(Work+Codex)分用兩個額度池
▼
結論:依任務輕重選模式,多數人 Chat 夠用
```
### 關鍵證據
1. **真實案例佐證 Work 能力**:Zapier 行銷團隊用 Work 每月自動審查數千條潛在客戶線索、追蹤互動、找出斷聯客戶、生成高階週報;維珍航空(Virgin Atlantic)用它做競品分析,把原本要花數週的活縮短到幾小時。
2. **「100 萬人用 Codex 不寫程式」的產品洞察**:Codex 原本給程式設計師,每週 500 萬人用,其中超過 100 萬人根本不寫程式,而是拿它做辦公雜活——OpenAI 因此把這部分需求正式化為 Work。這是「一個底層技術、兩個場景入口」的市場依據。
3. **額度擠占的具體提醒**:白天用 Work 跑複雜任務把額度耗得差不多,晚上想用 Codex 可能就不夠——這證明 Work 與 Codex 共用同一個「智能體額度」池,是使用者最容易踩的實務坑。
### 隱形假設與邊界
- **隱形假設**:
- 讀者能清楚分辨「我只是要問問題」與「我要它幫我把活做完」的邊界(實務上這條線常很模糊)。
- Work 的「交鑰匙成品」品質足以直接使用,不需大量人工後製(作者自己舉的反例其實是 Chat 需要後製,但 Work 是否真的免後製,文中未驗證)。
- **邊界條件(何時論點失效)**:
- 網頁版 Work 與桌面版 Work 目前**不互通**(雲端歸雲端、本地歸本地),跨端工作者會感到割裂。
- 免費版與 Go 檔只能用 Terra、不能選 Sol/Luna,進階型號選擇只對 Plus 以上開放。
- 原本的 ChatGPT 桌面端被改名為 ChatGPT Classic、不再更新,重度依賴舊版的用戶將面臨遷移成本。
## ROUND 3: SOUL | 靈魂提取
**「還能怎麼用」**
- **作者盲點**:作者把 Chat/Work/Codex 描述為涇渭分明的三件事,但實務上「我要它幫我做完」與「我要它回答」之間的界線非常主觀;他也未點出 Work「定時在背景跑」所衍生的隱私與授權風險(AI 自動連線 Slack、信箱、CRM 讀資料)。此外,他樂觀假設 Work 成品可直接用,但企業場景中「可用品」與「敢交付」之間往往還有一段品質與合規落差。
- **知識連接**:與 [[新版 ChatGPT 三模式]] 相關的是「產品場景化」這個永恆命題——同一個底層能力(LLM)如何透過不同的「輸入域+輸出形態」包裝成不同產品。它呼應了 Agent 架構中「orchestration layer vs. 單一模型」的分工,也與 Claude Cowork(Anthropic 的同類競品)形成直接對位。
- **行動觸發**:盤點你日常哪些任務是「我其實要的是成品,卻一直在用 Chat 拿文字再自己後製」——這些就是改用 Work 能立刻省時間的候選;但同時要設好 Work 連接外部工具時的授權範圍,別讓它自動讀取你不願曝光的資料。
### 留白提問(Guided Reflection)
- 當「用 AI」從「問問題」升級成「讓它在背景定時幫我幹活、自動連我的信箱與 Slack」,你願意交出多少授權?你設定的「停下來問我」的邊界,畫在哪裡?
- OpenAI 把「聊天」弱化成小入口、把「Codex 介面」保留下來——這是否暗示,未來人與 AI 的主要互動會從「對話」轉向「派任務」?你現在培養的 AI 使用習慣,是為哪一種未來做準備?
### 跨域映射
- 在 **產品設計**,這叫 **同一核心能力的場景化包裝(use-case packaging)**。
- 在 **Agent 架構**,這對應 **orchestration/agent 與基礎模型的分工**。
- 在 **訂閱經濟**,這是 **額度池設計(quota pool design)**——用「共用池」牽引用戶升級。
## DEEP READ | 精讀指引
> [!IMPORTANT]
> 學習的本質需要「認知阻力」。請親自回到原文閱讀以下核心段落,感受原始論述的阻力,不要只依賴 AI 的總結。
1. **「三模式怎麼區分」+裝修比喻段**:原文用「設計師/裝修隊長/水電工」把三模式差異打到最深——這個比喻同時區分了「交付物(建議/成品/專業活)」與「誰碰得了(一般人也碰/交鑰匙/專業人才才能碰)」,是全文理解密度最高的一段。
2. **「訂閱和額度,怎麼算的」段**:這段揭示了一個非直覺的設計——Chat 與(Work+Codex)分屬兩個額度池,而 Work 與 Codex 又會互相擠占。讀懂這個機制,才能解釋「為什麼白天用 Work、晚上 Codex 沒額度」,也是決定該不該升級 Plus/Pro 的關鍵。
3. **「GPT-5.6 的三個型號」段**:Sol/Terra/Luna 的「能力—速度—成本」三角,以及「預設 Terra 即可、免費版只能 Terra」的實務建議,是讀完就能立刻拿來做選擇的決策錨點。
## STRUCTURE MAP | 全書結構圖
```
┌──────────────────────────────────────────────
│ 新版 ChatGPT — 產品結構
│
│ 同一訂閱(免費 / Plus / Pro / 企業)
│ ┌────────────────────────────────
│ │
│ │ 額度池 A:Chat(聊天)
│ │ └ 網頁 / 手機 / 桌面 全端
│ │
│ │ 額度池 B:智能體(Work + Codex 共用,會互相擠占)
│ │ ├ Work 讀業務資料 → 交商務成品(文件/表格/簡報/網頁)
│ │ │ └ 可接 Slack/信箱/雲端/CRM,可定時背景跑
│ │ │ └ 網頁+手機已上線;桌面版最強(讀本地檔+瀏覽器)
│ │ └ Codex 讀程式碼 → 交程式碼變更 + 跑測試
│ │ └ 僅桌面端;手機只能遠端看進度
│ │
│ │ 模型層:GPT-5.6 三型號
│ │ ├ Sol 最強最貴(困難任務)
│ │ ├ Terra 預設日常(家用車)
│ │ └ Luna 最快最便宜(高吞吐)
│ │ (免費/Go 檔僅能用 Terra)
│ └────────────────────────────────
│
│ 舊桌面端 → 改名 ChatGPT Classic(不再更新)
└──────────────────────────────────────────────
```
---
# 新版 ChatGPT:Chat、Work、Codex,小白要知道的幾件事 (Architectural Deep Dive)
## 前言/背景
本文要解決的核心問題是:**OpenAI 發布新一代模型 GPT-5.6,同時把原本獨立的 Codex 應用併入 ChatGPT,介面因此出現 Chat/Work/Codex 三個模式——一個非技術的普通使用者,到底該點哪一個?** 作者用一個裝修房子的比喻貫穿全文,把三個模式的差異、可用端點、收費額度與 GPT-5.6 三型號選擇,整理成一份小白可直接照做的使用指南。
## 章節詳細總結
### 一、為什麼介面變了:GPT-5.6 + Codex 併入
開啟新版 ChatGPT,介面變了:頂部多了 Work 與 Codex 兩個可切換的模式,原本那個一開啟就能直接打字的「聊天框」,反而被折進一個叫 Quick chat 的小按鈕裡。無論你以前是拿 ChatGPT 聊天,還是拿 Codex 寫程式,現在開啟都是這副新樣子。

背後是 OpenAI 兩件大事:發布新一代模型 GPT-5.6,同時把原本獨立的 Codex 應用直接併進 ChatGPT。一合併,介面就成了現在這樣。
### 二、三模式怎麼區分:一句口訣 + 裝修比喻
先記住一句話:**Chat 回答問題,Work 幫你幹活,Codex 幫你寫程式。**

用裝修房子打比方,把三者想像成會打交道的三種人:
- **Chat 是設計師**:你問他「廚房太小怎麼改」,他跟你聊思路、給方案,動嘴不動手,快進快出。這就是大家最熟悉的一問一答。
- **Work 是裝修隊長**:你只要說一句「把這廚房按北歐風格裝好」,剩下的他全包——自己聯絡水電工、瓦工、木工,自己去買料,自己盯施工,最後交給你一把鑰匙、一個能直接用的成品。
- **Codex 是水電工**:他做最專業、最不能出錯的那部分。你說「牆後電路要改」,他直接拆牆、佈線、接電。這活兒設計師幹不了,一般人也別碰。
三者差異一句話總結:
- 設計師給你**建議**,你自己還得找人幹;
- 裝修隊長給你**做好的成品**,交鑰匙就能住;
- 水電工幹的是**專業活**,普通人碰不了的那部分。
### 三、Work 到底能幫你幹什麼
三個裡面,Chat 大家早會用了;Codex 名義上給程式設計師;真正新鮮、最值得先搞懂的是中間的 Work。
它跟 Chat 的差別在於**交付物**。你在 Chat 裡說「幫我寫個季度總結報告」,它給你一大段文字——寫得不錯,但你得自己複製出來、貼到 Word、調格式、排版、配圖,忙半天。Work 不一樣,它交給你的是一份**能直接用的成品**:排好版的文件、做好的表格、一套幻燈片,甚至一個小網頁。
它憑什麼能做到這一步?關鍵在於你可以把自己平時用的工具**接**給它:Slack、信箱、Google 雲端硬碟、行事曆、公司客戶管理系統……接好之後,你跟它說要什麼,它會自己鑽進這些工具裡翻資料、整合資訊、生成成品。對話時打個「@」再加應用名字,就能直接指定它去哪兒找資料。
兩個真實案例:
- **Zapier**:行銷團隊用 Work 搭了一套系統——每月自動審查數千條潛在客戶線索、追蹤這些客戶在郵件與系統裡的每一次互動、找出哪些客戶跟進斷了,最後生成一份給高階主管看的週報。
- **維珍航空(Virgin Atlantic)**:用它做競品分析,讓 AI 去調研各家航空公司的服務水準、整理成資料表。原本要花好幾週的活,縮短到幾個小時。
Work 還有個省心的本事:**定時幹活**。你可以給它設一個任務,讓它在背景自己跑,例如:
- 每天早上檢查信箱和 Slack 裡的新訊息,整理成簡報發給你;
- 每當有新客戶回饋進來,自動歸類、整理成產品改進建議;
- 網站資料有變化時,自動更新一份彙報文件。
你人不在電腦前,它也能自己推進。碰到拿不準的地方,它會停下來問你;重要的動作,也得你點頭才做,主動權始終在你手裡。
### 四、那 Codex 跟 Work 又有什麼不一樣
Work 和 Codex 其實是**同一套底層技術**,只是幹的活不一樣。差別就在**讀什麼、交什麼**:
- **Work** 讀的是你的**業務資料**(郵件、文件、聊天記錄、行事曆),交出來的是**商務成品**(文件、表格、幻燈片、網頁)。
- **Codex** 讀的是你的**程式碼**(程式設計師寫的那些專案檔),交出來的是**程式碼變更**(改好的程式、跑過的測試)。
一句話:Work 面向辦公室做方案、寫報告的人,Codex 面向寫程式的人。
為什麼本來就有 Codex,還要單獨搞個 Work?原因很現實:Codex 一開始給程式設計師寫程式用,每週有 500 萬人在用,但 OpenAI 發現其中超過 100 萬人壓根不是拿它寫程式,而是拿它做各種辦公雜活。於是 OpenAI 把這部分需求正式化,給它專門的入口和名字,叫 Work——連上辦公軟體,輸出文件和幻燈片,而不是程式碼。
一句話概括:**一套產品、兩個名字、兩種場景,吸引兩撥不同的人。**
### 五、有哪幾個端可以用
三個模式能用的地方不一樣:
- **Chat 最省心**:網頁、手機、電腦桌面端都有,隨便哪個都能用。
- **Work 正在鋪開**:網頁和手機上已開始上線;電腦桌面端上的 Work 更強,能讀你電腦裡的本機檔案,還自帶一個瀏覽器,能自己上網查資料。
- **Codex 只在桌面端**:手機上沒法直接用,但可以在 ChatGPT 手機 App 裡遠端看看電腦上正在跑的 Codex 任務進行到哪一步。
一個重要變化:原本獨立的 Codex 應用,現在已經併進新版 ChatGPT 桌面端了——以後一個 App 就能切換 Chat/Work/Codex,不用裝好幾個軟體。原本的 ChatGPT 桌面端被改名為 **ChatGPT Classic(經典版)**,你還能繼續用,但不會再更新。
還有個小坑:網頁上的 Work 對話,與電腦桌面端的 Work 對話,目前**不互通**——雲端歸雲端、本地歸本地。不過 Chat 的聊天記錄能在網頁與桌面端之間同步,這個不用擔心。
### 六、訂閱和額度怎麼算
兩個重點。
**第一點:聊天和幹活,用的是兩個不同的「額度」。**
你不需要為 Chat、Work、Codex 各自單獨訂閱——它們仨都屬於同一個 ChatGPT 訂閱,你辦一檔(免費、Plus、Pro 都行),這一檔裡就同時含著兩份額度。可以理解成 ChatGPT 在你這一個訂閱裡,給你分了兩個池子:
- 一個池子專門用來聊天(Chat),聊得再多都不影響另一個池子。
- 另一個池子給 Work 和 Codex 共用,OpenAI 管它叫**「智能體額度」**。
這就帶來一個要注意的地方:**Work 和 Codex 會互相擠占**。假如你白天用 Work 跑了一堆複雜任務、把額度用得差不多,晚上想再用 Codex,可能就發現額度不夠了。
**第二點:檔位越高,智能體額度越多。**
從免費版到企業版,Work 和 Codex 都能用,區別只在於那份智能體額度給多少:
- **免費版**:能試試 Work 和 Codex,但額度非常有限,嘗個鮮。
- **Plus(每月 20 美元)**:功能完整、沒廣告的第一檔,普通人想認真用,性價比最高。
- **Pro(每月 100 或 200 美元)**:額度是 Plus 的好幾倍甚至幾十倍,給重度使用者準備。
偶爾用用的話,免費版或 Plus 完全夠了,沒必要一上來就衝最貴的。
### 七、GPT-5.6 的三個型號,你該選哪個

GPT-5.6 不是單獨一個東西,而是分成三個型號:Sol、Terra、Luna。區別就在於**速度、能力、費用**:
- **Terra**:日常預設選它。能力足夠、速度不慢、價格適中。
- **Sol**:最強也最貴。適合特別複雜、要動腦想很久的任務——分析一大堆資料、設計複雜架構、解決很難的程式問題。
- **Luna**:最快最便宜。任務簡單、對速度敏感時用——快速整理清單、格式化文字。
用個類比:Terra 是家用車,Sol 是越野車,Luna 是小電動。日常代步用 Terra,爬山越野用 Sol,市區買菜接娃用 Luna。
不用太糾結——**絕大多數時候,預設的 Terra 就夠用**,OpenAI 自己也把它設成預設選項。唯一要注意:免費使用者和便宜一點的套餐(Go 檔)只能用 Terra,不能選 Sol 或 Luna;Plus 及以上才能三個型號隨便切換。
### 八、作者個人觀點
ChatGPT 與 Codex 的合併,OpenAI 預告了很久,這次總算上線。有意思的是:雖然名字保留的是 ChatGPT,但實際保留下來的是 Codex 的功能和介面,反倒是原本的 Chat 被弱化成一個最簡單的選單入口。網上不少人吐槽這個設計,作者倒覺得:既然有了 Work 模式,Chat 單獨存在的意義其實已經不大;之所以還留著,大概是架構上不好完全合併,也是想給那批只會用聊天框的老用戶留一個慢慢適應的過渡。
## 總結與結論
- **核心洞見 1:三模式本質是「交付深度」的三段化**。Chat 交付答案、Work 交付可用品、Codex 交付程式碼變更——OpenAI 用三個入口,把同一個底層 LLM 依「使用者要什麼程度的交付」切出三個市場,這是「同一能力、場景化包裝」的教科書案例。
- **核心洞見 2:Work 的誕生來自真實使用資料**。「500 萬 Codex 使用者中,超過 100 萬人不寫程式、只做辦公雜活」——這個數字直接催生了 Work。產品命名往往是落後於真實使用行為的,OpenAI 這次是「把既成事實正式化」。
- **架構建議 3:額度池設計是隱形的升級牽引**。Chat 與(Work+Codex)分用兩個池,且 Work 與 Codex 共用會互相擠占——這個機制會自然把「重度組合使用者」推向 Plus/Pro。實務上規劃用量時,要把 Work 與 Codex 當作同一個預算來控管。
- **架構建議 4:跨端不互通是當前最大摩擦**。網頁 Work 與桌面 Work 不互通、Codex 僅桌面端——選擇工作流時要把「在哪個端做完」先定下來,避免做到一半發現換端就斷掉。
- **決策建議 5:選擇可以極度簡化**。多數人→Chat;要交付成品→Work;寫程式→Codex;模型預設→Terra。把這四條當預設值,只有在任務明確超出時才偏離,能省下絕大多數決策成本。
Obsidian 整理
原始文章
AI工程
gpt-5.6-sol:如何在不上限的情況下用滿它 (without hitting limits)
"GPT-5.6-sol 很強也會自己一直做下去,但這讓額度燒得又快又難預測——先降推理、別碰 Ultra、暫停 fast mode、並在 prompt 裡寫死「做到哪裡就停」。"
Top 5 Insights
**核心洞見 1:更強的自主性=更難預測的成本**。5.6 相比 5.5「會一直跑下去」,可靠度提升的代價是單則訊息耗額度量級暴增(5.5 約 0.1%~2%,5.6 可達 15%);這是所有自主 agent 系統的通則——autonomy 提升,成本可預測性下降。 **架構建議 2:用 prompt 停止點當成成本煞車**。在 prompt 寫死「做到 X 就停、等我回應」的檢查點,是把「跑不停」的模型重新納入可控成本最直接的手段;這與提示工程的 autonomy policy 宣告同源。 **架構建議 3:subagent fan-out 是隱形的成本放大器**。「gpt-5.6-sol 永遠以同模型同推理 spawn subagent」這個機制,讓一次 spawn 等於一次等級不降的完整複製——降推理等級、在 AGENTS.md 加「only spawn when I ask」是必要的防護。 **營運建議 4:暫時避開兩個「加倍器」**。fast mode 的 2.5x 乘數與 Ultra 的 bug 性爆量,是當下最容易在單則訊息內燒掉 40% 額度的兩個開關;在 OpenAI 修 bug 前,預設關閉它們是最務實的選擇。 **時效提醒 5:本文建議有強保存期限**。多數「避開」建議(Ultra、fast mode、subagent 行為)綁定 Codex harness 當下的 bug 與 5.6 的早期行為,作者明說「等 bug 修了再回來」;讀者應把這些建議當「2026-07 的權變措施」,而非穩定知識,並隨版本更新重新驗證。
閱讀全文
---
tags: [AI工程, GPT-5.6, Codex, Agent架構, 成本優化]
date: 2026-07-13
read: false
source: "2026-07-13T095955+0800-gpt-5.6-sol without hitting limits.md"
original_title: "gpt-5.6-sol without hitting limits"
---
# gpt-5.6-sol:如何在不上限的情況下用滿它 (without hitting limits)

原始來源與檔名:2026-07-13T095955+0800-gpt-5.6-sol without hitting limits.md
---
## SOURCE | 資訊源評估
- **準確性**:中高 — 作者 @theo 自述已用 gpt-5.6-sol 燒掉超過 20 萬美元 token,屬重度實戰經驗;多數建議來自個人觀察與實測,並坦白標註哪些是「Codex harness 的 bug」、哪些是「我與 Codex 團隊溝通中」。部分數字(如單則訊息 15%、fast mode 2.5 倍)為個人使用情境,他人未必完全重現。
- **易理解性**:高 — 採條列式給出具體可執行建議,並附可直接抄的 prompt「停止點」範例,門檻低。
- **閱讀策略建議**:把它當「重度使用者的避坑清單」而非理論;重點抓三條——(1) 暫時避開 Ultra、(2) 暫時別用 fast mode(2.5 倍乘數+5.6 跑更長=單則訊息可能吃掉 40% 額度)、(3) 用 prompt 裡明確的「停止點」控制 5.6「一直跑下去」的傾向。注意文章時效性:作者多次標訳「等 bug 修了再回來」。
## NAPKIN | 餐巾紙
### 餐巾紙公式
> 5.6 跑得更長 = 更可靠,但也更會燒額度 → 用「停止點」+「降推理」+「避開 Ultra/fast」控管
_GPT-5.6 相比 5.5 會「一直跑下去」(單則訊息可能吃 15% 額度,開 fast mode 更飆到 40%),可靠度提升的代價是 token 消耗更難預測;控管手段是在 prompt 設明確停止點、預設 medium/high 推理、暫避 Ultra 與 fast mode。_
### 一句話
> GPT-5.6-sol 很強也會自己一直做下去,但這讓額度燒得又快又難預測——先降推理、別碰 Ultra、暫停 fast mode、並在 prompt 裡寫死「做到哪裡就停」。
### 餐巾紙草圖
```
┌──────────────────────────────────────────────
│ gpt-5.6-sol 省額度 — 控管四招
│
│ 5.5:常停下來要鼓勵 ──► 5.6:一直跑下去
│ (0.1%~2%/則) (最高 15%/則)
│ │
│ 控管: ▼
│ ┌────────────────────────────────
│ │ 1. 推理預設 medium/high(subagent 用 low/medium)
│ │ 2. 避開 Ultra(目前會爆量生 subagent + 高推理)
│ │ 3. 暫停 fast mode(2.5x 乘數 → 單則可達 40%)
│ │ 4. prompt 寫「停止點」控制跑不停
│ └────────────────────────────────
│
│ 模型選擇:$200 檔→ sol high;其他→ sol low
│ 進階:讓 Fable 當駕駛,spawn Codex subagent
└──────────────────────────────────────────────
```
## ROUND 1: SKELETON | 骨架掃描
**「這篇文章在說什麼」**
- **核心問題**:GPT-5.6-sol 很強,但在 200 美元 Codex Pro 訂閱上太容易撞到額度上限,該怎麼用得更久、燒得更少?
- **核心答案**:5.6 會「一直跑下去」,讓 token 消耗又大又難預測;控管手段是——預設 medium/high 推理、暫時完全避開 Ultra、暫停 fast mode(2.5 倍乘數太危險)、用 prompt 裡明確的「停止點」控制它的續航、並考慮讓 Fable 來當駕駛(drive)spawn Codex subagent。
- **論證結構**:清單+實證型。逐項給出踩坑觀察(effort levels、Ultra、fast mode、subagents、model selection、prompting),每項附「為什麼」與「怎麼做」。
### 章節骨架
1. **背景**:已燒 20 萬美元,5 小時窗口常提前用完
2. **Effort levels**:預設 medium/high
3. **Ultra**:暫時完全避開(bug)
4. **Fast mode**:暫停(2.5x 乘數太貴)
5. **Subagents**:最酷也最易自爆,要降推理+改 AGENTS.md
6. **Model selection**:$200 檔 sol high,其他 sol low
7. **Prompt better**:寫明確停止點
8. **Let another agent steer**:讓 Fable 當駕駛
9. **結語**:多實驗、監控用量
## ROUND 2: DISSECTION | 血肉解剖
**「憑什麼這麼說」**
### 論證鏈
```
5.6 比 5.5「跑得更久」(更可靠 end-to-end)
▼
副作用:token 消耗更難預測,單則訊息可達 15%(5.5 約 0.1%~2%)
▼
fast mode 2.5x 乘數 → 單則訊息可吃 40% 額度 → 大量人在此燒爆
▼
Ultra(非推理等級)+ Codex harness bug → 爆量生高推理 subagent
▼
對策:降推理 + 避 Ultra + 停 fast mode + prompt 停止點 + 換駕駛
```
### 關鍵證據
1. **單則訊息耗額度的量級對比**:忽略 /goal,5.5 單則訊息約用掉額度的 0.1%~2%,開 fast mode(2.5x)約 5% 峰值;但 5.6 作者見過單則訊息用到 **15%**,若再開 fast mode 乘數,等於**單則訊息吃掉 5 小時窗口的 40%**——這組數字是「暫停 fast mode」主張的硬支點。
2. **subagent 的「同模型同推理」bug**:gpt-5.6-sol **永遠**會以與父實例相同的模型與推理等級 spawn subagent,這正是 Ultra 目前「壞掉」的原因——一個具體、可驗證的機制,而非空泛抱怨。
3. **model selection 的務實分法**:作者自陳絕大多數工作仍用 gpt-5.6-sol,偶爾選 Terra 做快速審查;結論是「$200 檔 → sol high,其他 → sol low」,並強調「這些選項在智慧與成本上都碾壓 Sonnet 和 Opus」——用實戰偏好佐證模型選擇建議。
### 隱形假設與邊界
- **隱形假設**:
- 讀者也是 $200 Codex Pro 重度使用者(額度邏輯對輕度或不訂閱者參考價值有限)。
- 「Ultra 會爆量生 subagent」是 Codex harness 的 bug,會被修——作者明說「等 bug 解決再回來」,所以這些建議有強時效性。
- **邊界條件(何時論點失效)**:
- fast mode 對「延遲敏感、任務會卡住」的場景仍有價值,全面暫停是作者個人在 5.6 行為下的權衡,不是普世禁令。
- 「讓 Fable 當駕駛 spawn Codex subagent」是進階技巧,需多個訂閱與跨工具編排能力,多數使用者無法直接套用。
- 所有數字基於作者個人帳號的使用模式,他人額度消耗未必一致。
## ROUND 3: SOUL | 靈魂提取
**「還能怎麼用」**
- **作者盲點**:全文高度綁定「Codex harness 的當下缺陷」(v1/v2 split、auto-routing、Ultra bug),這些建議的保鮮期很短,一旦 OpenAI 修了 bug,多數「避開」建議就過時;作者雖有標註時效,但讀者容易把它當穩定知識記下。此外,作者以「燒 20 萬美元」為權威背書,但未拆解這 20 萬有多少是「可避免的浪費」、多少是「必要成本」。
- **知識連接**:核心觀念「更強的自主性=更難預測的資源消耗」是 Agent 系統的通則——不只 GPT-5.6,任何會自主 multi-step、會 spawn subagent 的 agent(Claude Code、Cursor、Devin)都面臨相同的「續航 vs 成本可控」張力。它也呼應「prompt 停止點」即一種 autonomy policy 的顯式宣告,與 [[GPT-5.6 提示詞大師課]] 的四要素框架同源。
- **行動觸發**:為你的 agent 工作流加兩道保險——(1) 在 prompt 裡寫死「做到 X 就停、等我回應」的檢查點;(2) 用用量監控工具(dashboards、ccusage、codexbar)建立對「單則訊息花多少」的直覺,而不是等撞上限才發現。
### 留白提問(Guided Reflection)
- 當模型「更可靠地自己跑到底」時,你省下的心力,有多少其實是用「不可預測的 token 帳單」換來的?你願意為「不必中途盯著」付出多少溢價?
- 作者建議「讓 Fable 當駕駛、去 spawn Codex subagent」——當你開始用一個 agent 去指揮另一個 agent,你對整個系統的理解,是否還跟得上它實際在做的事?還是你已經在駕馭一個你無法完全解釋的黑箱?
### 跨域映射
- 在 **Agent 架構**,這是 **autonomy vs cost predictability 的取捨**。
- 在 **分散式系統**,這對應 **子任務派發的成本放大效應(subagent fan-out cost)**。
- 在 **Prompt 工程**,這即 **顯式 checkpoint/停止條件宣告**。
## DEEP READ | 精讀指引
> [!IMPORTANT]
> 學習的本質需要「認知阻力」。請親自回到原文閱讀以下核心段落,感受原始論述的阻力,不要只依賴 AI 的總結。
1. **「Fast mode」段**:原文給出「5.6 單則訊息最高 15%、開 fast mode 等於單則吃掉 40% 額度」的計算,這是全文最具數字感、也最能說服人「暫停 fast mode」的一段;讀原文能體會那種「我知道這在燒掉很多人」的急迫。
2. **「Subagents」段**:作者點出「gpt-5.6-sol 永遠以同模型同推理 spawn subagent」這個具體機制,並給出三條可立刻做的對策(降推理、改 AGENTS.md 加『only spawn subagents when I ask』、開 hide_spawn_agent_metadata 旗標)——這段技術密度最高、最值得抄進自己的組態。
3. **「Prompt better」段的停止點範例**:兩段真實 prompt(「先寫計畫,完成後停下來問回饋」「放 PR、 babysit 第一輪審查後停下」)示範如何用具體停止點控制 5.6「跑不停」的傾向,是可立即套用的範本。
## STRUCTURE MAP | 全書結構圖
```
┌──────────────────────────────────────────────
│ gpt-5.6-sol 省額度 — 控管地圖
│
│ 根本原因:5.6「跑得更久」→ token 更難預測
│ ┌─ 5.5 單則約 0.1%~2%(fast 約 5%)
│ └─ 5.6 單則可達 15%(fast → 40%)
│
│ 四大控管
│ ┌────────────────────────────────
│ │ ① 推理等級
│ │ 預設 medium/high;subagent 用 low/medium
│ │
│ │ ② Ultra(非推理等級,UI 誤導)
│ │ 暫時「完全避開」→ harness bug 爆量生 subagent
│ │
│ │ ③ Fast mode(2.5x 乘數)
│ │ 暫停 → 與 5.6「跑更久」疊加會爆
│ │
│ │ ④ Prompt 停止點
│ │ 寫死「做到 X 停、等我回應」
│ └────────────────────────────────
│
│ 模型:$200 檔→ sol high / 其他→ sol low
│ 進階:Fable 當駕駛,spawn Codex subagent(需多訂閱)
│ 監控:dashboards / ccusage / codexbar
└──────────────────────────────────────────────
```
---
# gpt-5.6-sol:如何在不上限的情況下用滿它 (Architectural Deep Dive)
## 前言/背景
本文是知名開發者 @theo 的實戰避坑指南,要解決的核心問題是:**GPT-5.6-sol 是個極佳的模型,但在 200 美元 Codex Pro 訂閱上「太容易撞到上限」——當 5 小時窗口還剩 4 小時就被用罄時,該如何用得更久、燒得更少?** 作者自述已用 gpt-5.6-sol 燒掉超過 20 萬美元 token,把他踩過的坑整理成一份可立刻執行的建議。
## 章節詳細總結
### 一、背景:為什麼 5.6 特別容易撞上限
作者已用 gpt-5.6-sol 燒掉超過 20 萬美元 token,認為它是個極佳的模型;但在 200 美元 Codex Pro 訂閱上,太容易撞到上限。OpenAI 對重置(resets)算是大方,但當你把 5 小時窗口在前 1 小時就殺光、剩 4 小時時,重置也救不了你。作者犯過很多錯、也看到別人在犯同樣的錯,於是趕緊把建議寫出來。
### 二、Effort levels(推理等級)
預設用 **medium 或 high**,兩者都很好。**xhigh** 極為強大,但作者发现自己即便在編排大量 subagent 時也不太需要它(後述)。
### 三、「Ultra」
> Ultra 不是一個推理等級(reasoning level),儘管 UI 把它放在那個位置。它造成的混淆,類似 Claude Code 的「Ultracode」。
目前作者建議**完全避開 Ultra**。Codex harness 裡有 bug,會讓它 spawn 出「太多 subagent」、而且推理等級「太高」。作者說等 bug 解決後會重新評估。
### 四、Fast mode
作者很喜歡 fast mode、以前常用,對「容易中途停下、燒一堆才繼續」的模型很合理。但要記住:**fast mode 用掉 2.5 倍的額度**。
關鍵差異在於 5.5 與 5.6 的行為:
- **5.5** 常會停下來、需要鼓勵才繼續。忽略 /goal,5.5 單則訊息約用掉額度的 0.1%~2%;開 2.5x 後,單則約 5% 峰值。
- **5.6** 可以跑得**久得多**——這多半是好事,可以信賴它 end-to-end 完成任務;但也讓「token 消耗」難以預測。
作者見過 5.6 單則訊息用到 **15%**,因為它跑得實在太久。疊加 fast mode 乘數,等於**單則訊息吃掉你 5 小時窗口的 40%**。作者強調「我知道這在燒掉很多人,相信我,先別用 fast mode 一陣子」。
### 五、Subagents
這是 GPT-5.6 最酷的解鎖,但也最容易自爆(footgun)。Sol 很樂於 spawn subagent,這多半是好事;可惜 Codex 的實作有一整窩問題(v1/v2 split、依模型 auto-routing,先別提)。
關鍵機制(tl;dr):
> **gpt-5.6-sol 永遠會以「與父實例相同的模型與推理等級」spawn subagent。這正是 Ultra 目前「壞掉」的原因。**
你能做的幾件事:
1. **降低推理等級**——subagent 配 high 不算太糟,low/medium 也很棒。
2. **更新你的全域 AGENTS.md**,指定「only spawn subagents when I ask you to」(幫助抑制 5.6 過度 eager 的 subagent 生成)。
3. 若真的想讓 Codex 生成多層 subagent,可在組態啟用 `hide_spawn_agent_metadata = false` 旗標(問 Codex 怎麼做,可能需原始碼存取)。
作者正與 Codex 團隊溝通如何修這些行為,目前走一條「有點荒謬的繞路」來規避。
### 六、Model selection(模型選擇)
作者個人絕大多數工作仍用 **gpt-5.6-sol**;偶爾選 Terra 做快速審查或回饋,多半只是出於好奇。Luna 出奇地好,但它本來就不是給我們「手動選」的,比較像是給 code 用、以及讓 sol 拿來 spawn 成 subagent 的工具。
作者建議:
> **$200 檔 → sol high;其他 → sol low。**
Terra medium 看來是極大化用量的好選項,但作者用得不夠多、不敢斷言。(作者補一句:這些選項在智慧與成本上都「碾壓 Sonnet 和 Opus」。)
### 七、Prompt better(把 prompt 寫得更好)
這個模型會「一直、一直、一直做下去」。作者發現在 prompt 裡放清楚的「停止點(stop points)」非常有幫助。範例:
> 我要你實作這個新功能。先寫一份計畫。計畫完成後,**停下來問我回饋再繼續**。
> 計畫看起來很棒!來實作吧。用 computer use 測試你的實作。持續做到程式能跑、你對實作滿意為止。放 PR、babysit 第一輪審查意見並處理它們。**在第一輪審查意見處理完後停下,後面我來接手。**
注意這兩個範例的「任務長度」差很多。5.6 可以跑很久、也做得好,只是有時跑得太遠,所以非常受益於清楚的停止點。
### 八、Let another agent steer(讓別的 agent 來駕駛)
tl;dr——如果你有別的訂閱,讓 **Fable 來「駕駛」**。教它如何用 gpt-5.6 spawn subagent(或用 Cursor,它已經會了)。
作者在幾個訂閱之間切換(2 個 Claude $200、1 個 Codex $200)。Fable 也非常吃 token,但若用在較低推理等級、並給它如何 spawn Codex subagent 的 skill/指令,就非常強大。作者在一支關於「極大化 Fable 用量」的影片裡講了很多,這些技巧現在比以往更有用。
### 九、結語:多實驗
實驗在此刻極具價值。試不同做法、挑戰更難的任務、盡力監控用量(透過 dashboards、ccusage、codexbar,隨你喜歡)。你會驚訝於微小的改變能對產出與 token 消耗率帶來多大影響。
作者結語:「這真是當開發者的好玩時代。多玩玩。多待在 ~/.codex 和 ~/.claude 目錄裡。做一些感覺很蠢的改動。實驗。你會驚訝能發生什麼事。」
## 總結與結論
- **核心洞見 1:更強的自主性=更難預測的成本**。5.6 相比 5.5「會一直跑下去」,可靠度提升的代價是單則訊息耗額度量級暴增(5.5 約 0.1%~2%,5.6 可達 15%);這是所有自主 agent 系統的通則——autonomy 提升,成本可預測性下降。
- **架構建議 2:用 prompt 停止點當成成本煞車**。在 prompt 寫死「做到 X 就停、等我回應」的檢查點,是把「跑不停」的模型重新納入可控成本最直接的手段;這與提示工程的 autonomy policy 宣告同源。
- **架構建議 3:subagent fan-out 是隱形的成本放大器**。「gpt-5.6-sol 永遠以同模型同推理 spawn subagent」這個機制,讓一次 spawn 等於一次等級不降的完整複製——降推理等級、在 AGENTS.md 加「only spawn when I ask」是必要的防護。
- **營運建議 4:暫時避開兩個「加倍器」**。fast mode 的 2.5x 乘數與 Ultra 的 bug 性爆量,是當下最容易在單則訊息內燒掉 40% 額度的兩個開關;在 OpenAI 修 bug 前,預設關閉它們是最務實的選擇。
- **時效提醒 5:本文建議有強保存期限**。多數「避開」建議(Ultra、fast mode、subagent 行為)綁定 Codex harness 當下的 bug 與 5.6 的早期行為,作者明說「等 bug 修了再回來」;讀者應把這些建議當「2026-07 的權變措施」,而非穩定知識,並隨版本更新重新驗證。
Obsidian 整理
原始文章
AI視野
反向資訊悖論 (The Reverse Information Paradox)
"在 AI 時代,你每用一次模型,就在用自己最珍貴的隱性知識(corrections、evals、traces)繳學費——除非你把「學習迴圈」留在自己手裡。"
Top 5 Insights
**核心洞見 1:洩漏方向翻轉了**。Arrow 悖論的風險承擔者從「賣方」翻轉到 AI 時代的「買方」;企業的護城河命題從「保護資料」升級為「保護學習機制(corrections/evals/traces)」。 **核心洞見 2:價值會向基礎設施擁有者收斂**。當學習單向流動,經濟價值收斂到「擁有學習基礎設施的人」而非「創造知識的人」——這是平台經濟學在 AI 時代的最新版本,也是企業為何必須自控學習迴圈的結構性原因。 **架構建議 3:編排層必須與模型解耦(Choice)**。這是最關鍵、也最可立即行動的一條——任何架構若把商業邏輯綁死在單一模型上,就等於把「veteran capability」外包給了別人。驗證標準只有一個:「拔掉任一個模型,你還能跑嗎?」 **架構建議 4:evals 即權力(Control)**。私有 evals 不只是測試工具,而是組織「什麼叫做好」的定義權;誰擁有 evals,誰就擁有對齊(alignment)的主導權,這正是 Nadella 所說「企業對齊到自身問責義務的權利」。 **批判性提醒 5:留意作者的雙重身分**。Nadella 一邊批評「學習基礎設施擁有者」收斂價值,一邊代表的就是這類廠商;「把 learning infrastructure 分散到每家企業」的主張,本身高度契合混合雲/企業平台的商業利益。讀者應將 5C 視為合理的企業自保架構,同時對「分散式學習能否在品質上追得上集中式大模型」保持務實懷疑。
閱讀全文
---
tags: [AI視野, 資訊經濟學, 企業策略, AI治理, 知識管理]
date: 2026-07-13
read: false
source: "2026-07-13T095920+0800-The Reverse Information Paradox.md"
original_title: "The Reverse Information Paradox"
---
# 反向資訊悖論 (The Reverse Information Paradox)
原始來源與檔名:2026-07-13T095920+0800-The Reverse Information Paradox.md
---
## SOURCE | 資訊源評估
- **準確性**:高 — 作者 Satya Nadella(微軟 CEO)以企業 AI 平台領導者的立場提出論述,引用 Kenneth Arrow 的資訊經濟學經典與 Hayek 的「特定時空知識」概念,理論根基穩固;但須留意其立場帶有商業動機(推動企業自建 learning infrastructure 正符合 Azure 等平台廠商利益)。
- **易理解性**:中 — 概念密度高,使用了 Arrow paradox、distillation、token capital、hill climbing machine 等術語,需要對資訊經濟學與 AI 工程有一定背景才能完全吸收。
- **閱讀策略建議**:先抓住「Arrow 悖論 → 反向悖論」這組對照作為主軸,再理解「5C(Control / Capability / Choice / Cost / Compound)」作為企業對策的落地清單;建議搭配 OpenAI、Anthropic 的資料使用條款原文交叉比對 Nadella 對「status quo」的批評是否公允。
## NAPKIN | 餐巾紙
### 餐巾紙公式
> Arrow:賣方怕賣知識時把知識送出去 → 反向悖論:買方怕用 AI 時把知識洩出去
_資訊的價值在交易中流動,AI 時代把「洩漏風險」從賣方翻轉到買方;企業的護城河從「保護資料」升級為「保護學習機制」。_
### 一句話
> 在 AI 時代,你每用一次模型,就在用自己最珍貴的隱性知識(corrections、evals、traces)繳學費——除非你把「學習迴圈」留在自己手裡。
### 餐巾紙草圖
```
┌──────────────────────────────────────────
│ Arrow 資訊悖論 (1962)
│ ┌─────────────
│ │ 賣方
│ │ 「要先展示才知道值不值」
│ │ → 展示完 = 對方已拿到
│ └─────────────
│ ▼ 翻轉
│ 反向資訊悖論 (AI 時代)
│ ┌─────────────
│ │ 買方
│ │ 「要用得好就要餵專屬知識」
│ │ → 餵下去 = 賣方也在學
│ └─────────────
│
│ 學習流向: 企業 ─────► 模型廠商
│ (單向洩漏,trace by trace)
│
│ 對策 = 企業內部 trust boundary(5C):
│ Control ─ Capability ─ Choice ─ Cost ─ Compound
└──────────────────────────────────────────
```
## ROUND 1: SKELETON | 骨架掃描
**「這篇文章在說什麼」**
- **核心問題**:在 AI 時代,企業該如何保護讓自己獨一無二的核心智慧財產?
- **核心答案**:AI 把 Arrow 的「資訊悖論」反過來了——現在是「買方」(用 AI 的企業)在用產品時被迫洩漏自己的專屬知識;企業必須建立一道「信任邊界」,把 evals、traces、回饋、調適後的權重與記憶留在自己掌控的學習迴圈裡。
- **論證結構**:演繹+對比型。先立古典理論(Arrow),再點出「反向」轉折,接著推導後果(資訊不對稱單向傾斜),最後給出對策(5C 與 trust boundary)。
### 章節骨架
1. **古典悖論**:Arrow——賣方怕送出知識
2. **反向翻轉**:AI 時代換成買方怕洩知識
3. **雙重付費**:付錢+付專屬知識
4. **不對稱傾斜**:賣方愈用愈懂你
5. **對策總綱**:需要反向悖論的「專利」等價物
6. **洩漏機制**:exhaust(prompts、tools、corrections)
7. **你的智慧歸你**:Hayek 的特定時空知識
8. **現況諷刺**:廠商要公平使用、卻限制蒸餾
9. **信任邊界**:token capital 複利累積
10. **5C 落地**:Control / Capability / Choice / Cost / Compound
## ROUND 2: DISSECTION | 血肉解剖
**「憑什麼這麼說」**
### 論證鏈
```
Arrow:資訊交易中,價值須先揭露才能販售
▼
AI 顛倒方向:要用得強,就得餵專屬知識
▼
「雙重付費」=金錢 + 專屬知識(後者更珍貴)
▼
學習單向流動:賣方累積對你的理解,你卻學不到賣方學了什麼
▼
洩漏載體=exhaust(prompts、agent 工具、尤其是 corrections/evals)
▼
現況不公:廠商主張公開資料公平使用,卻對客戶蒸餾設限、保留向使用行為學習的權利
▼
價值會向「學習基礎設施擁有者」收斂,而非「知識創造者」
▼
結論:企業需把 learning infrastructure 分散到每家企業,自控學習迴圈(trust boundary + 5C)
```
### 關鍵證據
1. **Arrow 原始悖論**:引用 NBER 經典論文——「資訊對購買者的價值,在取得前未知;但取得後,等於已免費拿到」。這是整篇文章的理論支點。
2. **Alex Karp(Palantir)的引述**:「技術客戶要的是對 compute、models、data stack、以及他們 alpha 的控制權……他們要確知自己擁有生產工具,而非被轉移給別人。」——用客戶端語言佐證「控制權外流」是真實恐懼。
3. **corrections 作為最珍貴洩漏物**:「每一次模型出錯時你做的修正,都被蒸餾成機構知識……trace by trace、correction by correction、eval by eval 幾乎無感地洩漏。」——具體指出「哪一種資料」才是真正的高價值流失。
### 隱形假設與邊界
- **隱形假設**:
- 廠商「向客戶使用行為學習」是普遍現狀,而非少數條款(文章以「status quo」概括,未列舉具體廠商條款對照)。
- 企業有能力、有意願自建 learning infrastructure(事實上中小企業的 capability 與成本是巨大門檻)。
- 「token capital 能複利累積」假設累積的 traces/evals 品質足以驅動持續改善。
- **邊界條件(何時論點失效)**:
- 若主流模型廠商提供「零保留(zero retention)+ 不用於訓練」的企業合約,反向悖論的迫切性大減(Nadella 承認「status quo」會演進)。
- 對新創或缺乏專屬知識的企業,根本沒有值得保護的「token capital」,5C 投資報酬率存疑。
- 「分散 learning infrastructure 到每家企業」與模型規模經濟相悖,小廠自訓模型品質可能永遠追不上,反讓企業被困在較弱模型上。
## ROUND 3: SOUL | 靈魂提取
**「還能怎麼用」**
- **作者盲點**:Nadella 主張「把 learning infrastructure 分散到每家企業」,這恰好就是 Azure/混合雲廠商最想賣的東西——他自己就是被點名的「學習基礎設施擁有者」之一。文章把矛頭指向抽象的「status quo」,卻未誠實處理「平台廠商本身也是學習收斂的受益者」。此外,他把 corrections/evals 一律視為「應歸企業的資產」,但忽略了員工流動會帶走這類隱性知識,企業能否真正「擁有」存疑。
- **知識連接**:與 [[反向資訊悖論]] 相關的知識體系包括——資訊經濟學(Arrow)、知識理論(Hayek 的「散落在特定時空情境的知識」)、平台經濟學(價值向基礎設施擁有者收斂)、以及 AI 治理中的「資料外洩(data exhaust)」與「蒸餾(distillation)」管制。它也是「自建 vs. 外購」這個永恆架構抉擇在 AI 時代的最新版本。
- **行動觸發**:盤點你組織內「會餵給外部模型」的高價值知識清單(客戶資料、內部決策邏輯、對模型錯誤的修正);為關鍵工作流建立私有 evals;把編排層(orchestration)與單一模型解耦,確保任一模型被抽走仍能運作。
### 留白提問(Guided Reflection)
- 如果你的公司明天失去所有外部 AI 模型的存取權,你累積下來的 evals、traces、修正記錄,還能驅動任何一個「自己擁有」的能力嗎?還是這些資產其實只能依附在別人的模型上才有意義?
- 「每一次修正都是機構知識」——那麼當資深工程師離職,他對模型的數千次修正,究竟屬於他個人、屬於公司、還是已經不可逆地成了模型廠商的訓練訊號?
### 跨域映射
- 在 **資訊經濟學**,這叫 **Arrow 資訊悖論的反向版本(本文自訂詞:反向資訊悖論)**。
- 在 **AI 治理**,這對應 **data exhaust / 學習資料回流管制** 的議題。
- 在 **平台經濟學**,這是 **價值向基礎設施收斂(infrastructure value capture)** 的延伸。
- 在 **企業架構**,這等同 **自建 vs. 外購(build vs. buy)** 抉擇,只是標的從軟體換成「學習迴圈」。
## DEEP READ | 精讀指引
> [!IMPORTANT]
> 學習的本質需要「認知阻力」。請親自回到原文閱讀以下核心段落,感受原始論述的阻力,不要只依賴 AI 的總結。
1. **「反向悖論」轉折的那兩句**:原文「AI creates the reverse problem. In the AI age, the buyer risks giving away knowledge, just in order to use what they bought.」短短兩句完成古典悖論的對稱翻轉,是全文論證最精煉的支點,值得逐字體會其對仗結構。
2. **「exhaust」段落**:「Models learn from "exhaust," the prompts people write, the tools agents use, and especially the corrections people make when the model is wrong.」——這段把抽象的「知識洩漏」具象化成三種可觀測的載體(prompts/tools/corrections),是 5C 對策的打擊面,讀懂這裡才知道「Control」到底要控什麼。
3. **5C 收尾清單**:Control / Capability / Choice / Cost / Compound 五項,每一項都是一個可獨立行動的企業架構決策;建議逐條問自己「我們組織現在做到了哪幾項」,這比讀完整篇文章更能逼出落地缺口。
## STRUCTURE MAP | 全書結構圖
```
┌──────────────────────────────────────────────
│ 反向資訊悖論 — 論證結構
│
│ 古典 (Arrow) 反向 (AI 時代)
│ ┌──────────── ┌────────────
│ │ 賣方怕 │ 買方怕
│ │ 送出知識 │ 洩出知識
│ └──────────── └────────────
│ │ │
│ └──────── 對稱翻轉 ─────────┘
│ ▼
│ 後果:學習單向流動 企業 ──► 模型廠商
│ ▼
│ 洩漏載體:prompts / tools / corrections / evals
│ ▼
│ 對策:企業 trust boundary(5C)
│ ┌────────────────────────────
│ │ Control 私有 evals、記憶、traces 自持
│ │ Capability 租戶內自訓/微調
│ │ Choice 編排層與單一模型解耦
│ │ Cost 跨模型最佳成本組合
│ │ Compound 四者合一 → 持續學習迴圈
│ └────────────────────────────
└──────────────────────────────────────────────
```
---
# 反向資訊悖論 (The Reverse Information Paradox) (Architectural Deep Dive)
## 前言/背景
本文是微軟 CEO Satya Nadella 對「企業在 AI 時代如何保護核心智慧資產」提出的戰略論述。它要解決的核心問題是:**當使用 AI 模型的強度,直接取決於你願意餵多少專屬知識進去時,企業的競爭優勢(那些對模型做的修正、累積的 evals、調適後的權重)會不會在不知不覺中,單向流向模型供應商?** 作者用經濟學家 Kenneth Arrow 的「資訊悖論」做鏡像,提出「反向資訊悖論」這個概念框架,並以 5C(Control / Capability / Choice / Cost / Compound)給出企業層級的架構對策。
## 章節詳細總結
### 一、Arrow 的資訊悖論:理論原點
諾貝爾經濟學家 Kenneth Arrow 經典地描述了資訊市場的內在矛盾:
> 「資訊對購買者的價值,在他取得之前無法得知;但一旦取得,等於已經免費拿到了。」
在 Arrow 的版本裡,**賣方**承擔風險——為了賣出知識,必須先展示,而展示本身就把價值交了出去。專利(patent)這個制度,正是為了解決 Arrow 悖論的其中一面:它讓發明人可以揭露點子而不必白白送人。
### 二、反向翻轉:買方變成風險承擔者
AI 把這個悖論整個翻轉:
> 「在 AI 時代,買方為了使用他買到的東西,反而冒著洩漏知識的風險。」
作者的洞見是「雙重付費」——你為智慧(intelligence)付費兩次:
- 第一次,付錢;
- 第二次,付「更珍貴的東西」:為了讓模型表現更好,你必須餵給它的**專屬知識(proprietary knowledge)**。
而且這是一條斜率不斷加劇的曲線:**你想讓模型表現得越好,就必須餵越多知識進去。**
### 三、單向的資訊不對稱
隨時間推移,資訊不對稱會愈來愈傾斜:
> 「賣方在你使用產品時,對你了解得愈來愈多;而你對賣方究竟學到了什麼,幾乎一無所知。」
這就是作者所稱的 **反向資訊悖論(Reverse Information Paradox)**。它的危險不在於一次性大量洩漏,而在於「trace by trace、correction by correction、eval by eval」這種幾乎無感、持續性的滲透。
### 四、洩漏的載體:exhaust
模型從「exhaust(尾氣/副產物)」中學習,作者明確點出三類載體:
- 人們寫的 **prompts**;
- agent 使用的 **tools**;
- 尤其是當模型出錯時,人們所做的 **corrections(修正)**。
每一次修正,都被蒸餾成機構知識(institutional know-how)——那種「競爭對手永遠買不到、卻會一點一滴洩漏」的知識。
### 五、你的智慧應該歸你:Hayek 的特定時空知識
作者援引 Hayek 的概念,主張你在使用 AI 的過程中,其實也在**創造**智慧:
> 「你在消耗智慧的同時,也在創造智慧。而你創造的,應該屬於你。」
這是「你的特定智慧(your particular intelligence)」——關於時間、地點、情境的知識,沒有別人能持有;它知道你想什麼、重視什麼、如何衡量成功。
### 六、對現況的諷刺與批評
作者對當前業界提出相當尖銳的批評:模型供應商主張對公開資料有公平使用權來訓練模型(這項偉大創新確實必要),但諷刺的是,他們**轉過頭來卻對「蒸餾」設下限制條款,並保留向客戶使用與互動資料學習的權利**。
> 「如果學習只往一個方向流動,經濟價值會向『學習基礎設施的擁有者』收斂,而非向『知識本身的創造者』收斂。」
因此作者主張:**必須把 learning infrastructure 分散到每家企業,讓他們控制自己的學習迴圈。**
### 七、信任邊界與 token capital
企業需要一道真正的 **trust boundary(信任邊界)**,讓「human capital 與 token capital 能夠複利累積」。這道邊界是組織的資料、traces、evals、調適後的權重與記憶共同累積與改善之處,而且是一道**硬邊界**——未經同意,什麼都不能跨越,連 intelligence exhaust 也不例外。
企業會主張:有權使用模型輸出來 fine tune/訓練自己的模型。作者將此稱為「每家企業將模型對齊到其企業問責義務的權利」。
### 八、對策:5C
作者用「雲端時代累積資料、AI 時代累積學習」做總結,並列出每家企業必須做的五件事(5C):
- **Control(控制)**:建立私有 evals——因為 evals 定義了組織內部「什麼叫做好」。同時保留對記憶、traces、回饋、決策與機構情境的所有權,以及使用自己任務/查詢之模型輸出的能力。
- **Capability(能力)**:在租戶邊界(tenant boundary)內建立自有的專屬學習環境,用來訓練或微調模型,讓模型對真實工作流程學習,卻不暴露公司知識。
- **Choice(選擇)**:確保編排層(orchestration layer)與任何單一模型解耦。自問:若你正在用的任一個模型被抽走,你是否仍能用其他模型繼續運作並針對你的 evals 優化?你的「老兵(veteran)」能力是否即使某個「通才(generalist)」模型被抽走仍留在你身邊?
- **Cost(成本)**:透過解耦編排層,能用最有效率、最符合成本的方式整合 context、models 與 tasks,而不犧牲品質。
- **Compound(複利)**:把前四項結合起來,就創造出自己的持續學習迴圈(作者稱之「hill climbing machine」——爬山機),讓 AI 投資能為企業複利累積價值。
作者最後一句話收束全篇:
> 「一家公司應該能在不放棄讓自己獨一無二的知識的前提下,使用模型。這就是我們必須面對的反向資訊悖論。」
## 總結與結論
- **核心洞見 1:洩漏方向翻轉了**。Arrow 悖論的風險承擔者從「賣方」翻轉到 AI 時代的「買方」;企業的護城河命題從「保護資料」升級為「保護學習機制(corrections/evals/traces)」。
- **核心洞見 2:價值會向基礎設施擁有者收斂**。當學習單向流動,經濟價值收斂到「擁有學習基礎設施的人」而非「創造知識的人」——這是平台經濟學在 AI 時代的最新版本,也是企業為何必須自控學習迴圈的結構性原因。
- **架構建議 3:編排層必須與模型解耦(Choice)**。這是最關鍵、也最可立即行動的一條——任何架構若把商業邏輯綁死在單一模型上,就等於把「veteran capability」外包給了別人。驗證標準只有一個:「拔掉任一個模型,你還能跑嗎?」
- **架構建議 4:evals 即權力(Control)**。私有 evals 不只是測試工具,而是組織「什麼叫做好」的定義權;誰擁有 evals,誰就擁有對齊(alignment)的主導權,這正是 Nadella 所說「企業對齊到自身問責義務的權利」。
- **批判性提醒 5:留意作者的雙重身分**。Nadella 一邊批評「學習基礎設施擁有者」收斂價值,一邊代表的就是這類廠商;「把 learning infrastructure 分散到每家企業」的主張,本身高度契合混合雲/企業平台的商業利益。讀者應將 5C 視為合理的企業自保架構,同時對「分散式學習能否在品質上追得上集中式大模型」保持務實懷疑。
Obsidian 整理
原始文章
Prompt工程
GPT-5.6 Prompt 到底該怎麼寫?OpenAI 官方指南,一篇講透!
"GPT-5.6 不需要神級 prompt,你只需要把五件事說清楚:Context(背景)、Request(要什麼+完成標準)、Output Format(怎麼交付)、Constraints(邊界與權限)、Checkpoint(何時續、何時停)。"
Top 5 Insights
**核心洞見 1:GPT-5.6 把 prompt 工程從「過程控制」轉向「結果定義」**。模型已能判斷目標與工作量,舊式「角色+多輪反思+叮嚀」的隆重寫法過時;重心應放在「要什麼、怎樣算完成、哪些不能做、何時該停」。OpenAI 內部數據(Eval +10~15%、token −41~66%、成本 −33~67%)是最硬的佐證。 **架構建議 2:CROCC(本文自訂詞)是四要素框架的中文實作版**。Context/Request/Output Format/Constraints/Checkpoint 五項,本質是 [[GPT-5.6 提示詞大師課]] 的 Outcome/Constraints/Evidence/Autonomy 中文重組——把 Outcome 拆成 Context+Request、把 Autonomy 細化為 Checkpoint、補上 Output Format。兩篇同源、可互補。 **架構建議 3:prompt 長度依任務複雜度四檔伸縮**。簡單(R+O)/普通(C+R+O)/複雜研究(全框架)/Agent(再補工具+權限+驗證命令),打破「越長越專業」的迷思——長度應跟著複雜度與風險走。 **架構建議 4:模型/推理/Pro 三軸以實測為準**。預設 Terra+medium;模型越強不代表越適合所有任務(Luna 能穩定做的就別上 Sol);Pro Mode 只在邊際品質提升實際影響結果時開,並用同一批真實任務做 Standard vs Pro 對照。 **方法論提醒 5:用「自檢五問」取代模板崇拜**。與其追求固定模板,不如每次寫完 prompt 用五個問題自檢(要什麼/算完成/不能猜/不能越界/何時停)——這比背誦任何框架都更能逼出 prompt 的真實缺口。引用 CROCC 一詞時宜標明為作者自訂、非 OpenAI 官方命名。
閱讀全文
---
tags: [Prompt工程, GPT-5.6, OpenAI, AI工程, 模型指南]
date: 2026-07-13
read: false
source: "2026-07-13T100005+0800-GPT-5.6 Prompt 到底该怎么写?OpenAI 官方指南,一篇讲透!.md"
original_title: "GPT-5.6 Prompt 到底该怎么写?OpenAI 官方指南,一篇讲透!"
---
# GPT-5.6 Prompt 到底該怎麼寫?OpenAI 官方指南,一篇講透!

原始來源與檔名:2026-07-13T100005+0800-GPT-5.6 Prompt 到底该怎么写?OpenAI 官方指南,一篇讲透!.md
---
## SOURCE | 資訊源評估
- **準確性**:中高 — 作者 @RealCodedAlpha 自陳基於 OpenAI 官方 GPT-5.6 Model Guidance(developers.openai.com/api/docs/guides/latest-model)整理,並附官方原文連結;與同源的 @aiedge_ 譯作([[GPT-5.6 提示詞大師課]])核心數字一致(Eval +10%~15%、token −41%~66%、成本 −33%~67%),互為佐證。但作者自行發明的 CROCC 框架(Context/Request/Output/Constraints/Checkpoint)非官方命名,屬個人重組。
- **易理解性**:高 — 以中文讀者為目標,提供大量「舊 prompt vs 新 prompt」對照範例與一份完整的財報分析 prompt 範本,可直接複製使用。
- **閱讀策略建議**:把它當「官方指南的中文化實作版」——重點抓兩件事:(1)「舊 prompt 最該刪什麼」的五類清單(形容詞/重複規則/思考流程/無用角色/過多工具);(2) CROCC 五要素框架與「依任務複雜度分四檔」的長度指南。CROCC 一詞為作者自訂,引用時宜標明出處。
## NAPKIN | 餐巾紙
### 餐巾紙公式
> 與其教 GPT-5.6「怎麼想」,不如說清「要什麼、怎樣算完成、哪些不能做、何時該停」
_GPT-5.6 更懂上下文與工作量,舊式「角色+多輪反思+叮嚀」的隆重 prompt 已過時;有效寫法是把重心從「過程控制」轉移到「結果定義+邊界+停止條件」。_
### 一句話
> GPT-5.6 不需要神級 prompt,你只需要把五件事說清楚:Context(背景)、Request(要什麼+完成標準)、Output Format(怎麼交付)、Constraints(邊界與權限)、Checkpoint(何時續、何時停)。
### 餐巾紙草圖
```
┌──────────────────────────────────────────────
│ GPT-5.6 Prompt 新重心 — CROCC(本文自訂詞)
│
│ 舊:角色 → 分析 → 計畫 → 反思 → 叮嚀(過程控制)
│ ▼ 反轉
│ 新:背景 → 要什麼 → 交付 → 邊界 → 停止點(結果定義)
│
│ ┌────────────────────────────────
│ │ C Context 會改變結果的背景
│ │ R Request 目標+任務+完成標準
│ │ O Output Format 怎麼交付
│ │ C Constraints 來源/範圍/權限/禁止
│ │ C Checkpoint 續 vs 停的條件
│ └────────────────────────────────
│
│ 長度依任務複雜度:
│ 簡單 → R+O / 普通 → C+R+O / 複雜研究 → 全框架
│ Agent/Codex → 再補工具+權限+驗證命令
│
│ 模型 Sol/Terra/Luna × 推理 6 檔(預設 medium)
└──────────────────────────────────────────────
```
## ROUND 1: SKELETON | 骨架掃描
**「這篇文章在說什麼」**
- **核心問題**:面對 GPT-5.6,中文使用者到底該怎麼改寫現有 prompt?
- **核心答案**:GPT-5.6 更能理解你的最終目標與所需工作量,所以別再「教它怎麼思考」,改用 CROCC 框架說清「背景、要什麼+完成標準、交付方式、邊界與權限、停止條件」;prompt 長度應跟著任務複雜度與風險走,而非為了「顯得高級」不斷變長。
- **論證結構**:對比+清單型。先用「舊 vs 新」範例點出轉變,再用「該刪什麼」清單做減法,接著提出 CROCC 框架做加法,最後給完整範本與長度分檔指南。
### 章節骨架
1. **轉變**:少教怎麼想,多說要什麼
2. **刪減**:舊 prompt 最該刪的五類
3. **更短**:預設更短,但保留結論/證據/限制/下一步
4. **CROCC 框架**:背景/任務/交付/邊界/停止
5. **完整範例**:財報分析 prompt
6. **長度分檔**:簡單/普通/複雜/Agent 四檔
7. **模型選擇**:Sol/Terra/Luna
8. **推理強度**:六檔怎麼用
9. **Pro Mode**:何時值得開
## ROUND 2: DISSECTION | 血肉解剖
**「憑什麼這麼說」**
### 論證鏈
```
GPT-5.6 更懂上下文與所需工作量
▼
舊式「過程控制」prompt(角色/多輪反思/叮嚀)→ 冗長且無效
▼
實證:刪重複指令/無效範例/冗長工具說明 → Eval +10~15%、token −41~66%、成本 −33~67%
▼
做減法:刪五類(形容詞/重複規則/思考流程/無用角色/過多工具)
▼
做加法:CROCC 框架定義「要什麼+邊界+停止點」
▼
長度依任務複雜度四檔伸縮,模型/推理/Pro 按任務選
```
### 關鍵證據
1. **OpenAI 內部 Coding Agent 測試數據**:刪除重複指令、無效範例、冗長工具說明後,Eval 分數提高約 10%~15%、總 token 減少約 41%~66%、成本減少約 33%~67%——這組區間數字(比 @aiedge_ 的單點「+15%/−60%」更保守、給範圍)是「prompt 變短更好」的硬證據。
2. **「舊 vs 新」財報 prompt 對照**:舊版「請深入分析這家公司最新一季財報,判斷業績好不好,給投資建議」問題一堆(沒指明公司、無判斷標準、無資料來源、沒區分事實與推論、範圍過大);改寫後用 CROCC 結構把「研究對象、要回答的問題、完成標準、可用資料、不可下的結論、交付格式、停止條件」全部講清——這個具體實體比任何抽象論述都更能示範框架價值。
3. **「重複規則反效果」的機制**:同一條權限規則寫兩遍不會更安全,反而可能讓模型在讀檔、查 log、跑測試這些正常操作前也停下來問——這與 [[GPT-5.6 提示詞大師課]] 的觀察完全一致,互相佐證。
### 隱形假設與邊界
- **隱形假設**:
- CROCC 五要素的「順序與切分」是普適的(實際上不同任務,要素重要性不同,例如創作類 Request 為主、合規類 Constraints 為主)。
- 使用者能寫出可驗證的「完成標準」——但這恰恰是多數人最弱的一環。
- **邊界條件(何時論點失效)**:
- 高合規場域仍需詳盡的過程與來源要求,「短」不能無條件套用。
- 「模型越強不代表越適合所有任務」——若 Luna 已能穩定做欄位抽取,換 Sol 只會增加成本,框架的「模型選擇」須以實測為準。
- 作者的「四檔長度」與 CROCC 命名為個人方法,非 OpenAI 官方,引用宜標明(本文自訂詞)。
## ROUND 3: SOUL | 靈魂提取
**「還能怎麼用」**
- **作者盲點**:CROCC 與「四檔長度」是作者把官方零散建議重組後的自創框架,但他陳述時與官方建議混在一起,讀者容易誤以為是 OpenAI 的正式命名(作者僅在文末說「下面這套結構,是我……重新整理出的中文實用框架」,強調不夠)。此外,全文以「研究/分析」任務為主要範例,對「創作型」「對話型」任務的適配著墨很少。
- **知識連接**:CROCC 本質是 [[GPT-5.6 提示詞大師課]] 四要素(Outcome/Constraints/Evidence/Autonomy)的中文重組版——把 Outcome 拆成 Context+Request、把 Autonomy 細化為 Checkpoint、加入 Output Format。兩篇同源、可互補對照。它也呼應軟體工程的需求文件寫作:Context=背景、Request=使用者故事+驗收標準、Constraints=非功能性需求、Checkpoint=釋放條件。
- **行動觸發**:拿作者結尾的「五個自問」當 prompt 自檢表——模型知道我要什麼嗎/知道怎樣算完成嗎/知道哪些資訊不能猜嗎/知道哪些操作不能越界嗎/知道什麼時候該停嗎;寫完任何一支 prompt,逐一打勾。
### 留白提問(Guided Reflection)
- 作者主張「模型越強,不代表越適合所有任務」——你現在的工作流裡,有多少任務其實是用 Sol 在做 Luna 就夠的事?你選模型的依據,是實測,還是「貴的比較好」的直覺?
- CROCC 把「Checkpoint(停止條件)」單列一項——這是否暗示,在 agent 時代,「知道什麼時候不該繼續」與「知道要做什麼」一樣重要?你給自己日常工作定的 checkpoint 是什麼?
### 跨域映射
- 在 **軟體需求工程**,CROCC 對應 **背景+使用者故事+驗收標準+非功能需求+釋放條件** 的組合。
- 在 **Prompt 工程**,這是 [[GPT-5.6 提示詞大師課]] 四要素框架的中文重組(本文自訂詞:CROCC)。
- 在 **專案管理**,Checkpoint 即 **stage gate/definition of done**。
## DEEP READ | 精讀指引
> [!IMPORTANT]
> 學習的本質需要「認知阻力」。請親自回到原文閱讀以下核心段落,感受原始論述的阻力,不要只依賴 AI 的總結。
1. **「二、舊 Prompt 最先應該刪掉什麼?」整段**:作者把「該刪的」分成五類(無法驗證的形容詞/重複出現的規則/不必要的思考流程/無實際作用的專家角色/只保留當前任務需要的工具),每一類都給原文範例與「為什麼該刪」的機制,是全文最具操作性的減法清單。
2. **「四、一套適合中文用戶的 Prompt」+「五、Prompt 完整示例」**:CROCC 五要素的定義+一份完整的財報分析 prompt 範本(從 Context 到 Checkpoint 全展開),這段是全文資訊密度最高、最值得複製到自己範本庫的實體;讀原文能感受到「把抽象框架落到可貼上程式碼」的阻力。
3. **「六、不同任務,Prompt 應該寫多長?」四檔段**:簡單(R+O)/普通(C+R+O)/複雜研究(全框架)/Agent(再補工具+權限+驗證),這個「長度依複雜度伸縮」的分法,比「一律寫短」或「一律寫長」都更實用,是打破「prompt 越長越專業」迷思的關鍵。
## STRUCTURE MAP | 全書結構圖
```
┌──────────────────────────────────────────────
│ GPT-5.6 Prompt 中文實作 — 結構
│
│ 轉變:少教「怎麼想」 → 多說「要什麼」
│ ▼
│ ┌─ 做減法(刪五類)──────────────
│ │ 形容詞 / 重複規則 / 思考流程 / 無用角色 / 過多工具
│ └────────────────────────────────
│ ▼
│ ┌─ 做加法(CROCC,本文自訂詞)──
│ │ Context 會改變結果的背景
│ │ Request 目標+任務+完成標準
│ │ Output Format 交付方式
│ │ Constraints 來源/範圍/權限/禁止
│ │ Checkpoint 續 vs 停
│ └────────────────────────────────
│ ▼
│ 長度四檔:簡單(R+O) / 普通(C+R+O) / 複雜(全) / Agent(+工具權限驗證)
│ ▼
│ 模型 Sol/Terra/Luna + 推理 6 檔(預設 medium)+ Pro Mode(困難才開)
│
│ 自檢五問:要什麼?算完成?不能猜?不能越界?何時停?
└──────────────────────────────────────────────
```
---
# GPT-5.6 Prompt 到底該怎麼寫?OpenAI 官方指南,一篇講透! (Architectural Deep Dive)
## 前言/背景
本文作者 @RealCodedAlpha 要解決的核心問題是:**OpenAI 發布了 GPT-5.6 的官方使用指南,但中文使用者不必自己啃英文文件——如何把官方指南重新整理成一套適合中文使用者、能直接拿來改寫現有 prompt 的實用方法?** 全文的核心主張是:GPT-5.6 更能理解你的最終目標與所需工作量,所以舊式「先給角色、再規定分析/計畫/反思、最後叮嚀深入思考」的隆重寫法已過時;有效寫法是把重心從「過程控制」轉到「結果定義+邊界+停止條件」。
## 章節詳細總結
### 一、GPT-5.6 到底改變了什麼
OpenAI 官方指南提到,GPT-5.6 更擅長從上下文判斷使用者的真實目標與任務所需工作量,這意味著你通常不再需要把每一步執行流程都提前寫出來。
以前我們常這樣寫:
```plaintext
你是一位擁有二十年經驗的資深研究專家。
請先理解問題,再制定詳細計畫。
從多個角度進行三輪分析。
模擬不同專家提出反對意見。
完成後重新反思和檢查。
```
這段 prompt 很長,但模型仍然不知道你最後要什麼!換成下面這樣反而更清楚:
```plaintext
分析這家公司最近一個季度的業績。
最終回答:
1. 收入和利潤分別由什麼驅動
2. 哪些增長屬於一次性因素
3. 管理層指引發生了什麼變化
4. 哪些風險可能改變當前結論
所有數字註明來源。
區分事實、推論和判斷。
無法確認的資訊明確標記。
```
第二個版本沒有規定模型必須思考幾輪,卻把真正影響結果的內容寫清楚了。OpenAI 的建議是**減少不必要的過程控制,同時繼續保留背景、硬性限制、權限邊界和完成標準**。
**Prompt 變短,真的會更好嗎?** OpenAI 在一組內部 Coding Agent 測試裡發現,減少重複指令、無效範例和冗長工具說明後:
- Eval 分數提高約 **10%~15%**
- 總 token 減少約 **41%~66%**
- 成本減少約 **33%~67%**
這些數字不代表每個任務都會得到同樣結果,但至少說明一件事:**Prompt 寫得更長,並不等於模型會做得更好。** 真正穩妥的做法是:先刪一組重複規則、跑原來的測試、再刪無效範例、繼續跑同一組測試、再縮短工具說明、重新比較——每次只改一類內容,才知道究竟是哪項調整帶來了改善。
### 二、舊 Prompt 最先應該刪掉什麼
1. **刪除無法驗證的形容詞**——例如「請深入、全面、專業、嚴謹地分析這個問題。認真檢查,不要遺漏任何重要內容。」「深入」可能代表多寫一些內容,也可能代表分析底層原因、補充反例、核查數據或說明風險,模型只能猜。
2. **刪除重複出現的規則**——例如「先問我,不要修改,等待批准,未經允許不能執行。遇到不確定情況先確認,不要擅自修改。」同一條規則寫兩遍不會讓任務更安全,反而可能帶來反效果:模型在讀取檔案、檢查 log、跑測試這些正常操作前,也會不斷停下來詢問。OpenAI 官方建議:**每條權限規則只寫一次,並明確列出哪些本地安全操作可以直接執行。**
3. **刪除不必要的思考流程**——例如「請進行三輪深度反思、模擬五位專家互相討論、提出三個方案再逐一反駁、展示完整思考過程。」對大部分任務,這些流程只會讓 prompt 更長。
4. **刪除沒有實際作用的專家角色**——例如「你是一位世界頂級、擁有二十年經驗的跨學科專家。」如果角色不會影響判斷角度、語言、重點或驗收標準,就可以刪除。
5. **只保留當前任務需要的工具**——如果一個 agent 有二十個工具,而當前任務只需要搜尋、讀取檔案和計算,就沒必要把二十個工具全部暴露給模型。工具越多,模型要做的選擇越多,工具說明本身也會佔用上下文。OpenAI 建議只保留當前任務真正相關的工具,並讓工具描述保持簡潔、明確。
### 三、GPT-5.6 預設回答更短,Prompt 也要跟著調整
OpenAI 官方也給出類似思路:短答案仍應保留**結論、證據、重要限制和下一步**,優先刪掉重複、次要背景和通用安慰。推薦寫法不是單純要求「短」,而是告訴模型哪些內容必須保留、哪些可以優先刪除:
- 先給結論
- 必須保留:支持結論的核心證據、會改變結論的重要限制、下一步行動
- 優先刪除:通用開場、重複總結、次要背景、空泛提醒
這樣模型知道精簡的優先級;GPT-5.6 預設比 GPT-5.5 更簡潔。
### 四、一套適合中文使用者的 Prompt(CROCC,本文自訂詞)
OpenAI 官方沒有規定所有 prompt 必須用某個固定模板。下面這套結構,是作者根據官方關於背景、目標、完成標準、輸出、權限和停止條件的建議,重新整理出的中文實用框架:
**Context、Request、Output Format、Constraints、Checkpoint**
對應中文:背景、任務與完成標準、交付方式、邊界與權限、停止條件。它是一套更適合中文使用者、研究任務、agent 與 Codex 場景的組織方式。
**Context:完成任務必須知道什麼**——只放會改變結果的資訊,通常包括:目標讀者、輸入資料、時間範圍、技術棧、專案當前狀態、已完成的步驟、已知事實。例如:
```
Context:這篇文章面向已經使用過 ChatGPT,但還不熟悉 API 和 Agent 的中文使用者。資料截止日期為 2026-07-11。
```
這兩句話會直接影響內容深度和事實範圍。
**Request:最後要什麼,怎樣才算完成**——是整份 prompt 最重要的部分,應同時包含:最終目標、具體任務、完成標準。例如:
```
Request:寫一篇幫助普通使用者理解 AI Agent 的入門指南,需要回答:
1. 哪些任務適合使用 Agent
2. Tool Calling 解決什麼問題
3. 為什麼需要權限邊界
4. 如何搭建一個最小工作流
完成標準:
1. 當前產品資訊使用官方來源核實
2. 提供一個可以直接複製的範例
3. 區分事實、推論和實踐建議
4. 說明外部寫入和人工確認風險
```
**Output Format:最後怎樣交付**——例如:
```
Output Format:
- 簡體中文 Markdown
- 2000~2500 字
- 先給結論,再給步驟
- 只在需要比較時使用表格
- 程式碼必須可以直接複製
- 引用放在對應事實之後
```
規定輸出的格式必須是 markdown 形式的文件。
**Constraints:事實、範圍和權限**——不只是「不能做什麼」,還要說明:資訊可以來自哪裡、哪些內容不能猜、任務做到什麼範圍、哪些操作可以直接執行、哪些操作必須先確認。
**Checkpoint:什麼時候繼續,什麼時候停止**——用來解決兩個常見問題:模型遇到任何小問題都停下來問;模型遇到高風險情況仍然繼續執行。例如:
```
Checkpoint:普通措辭、結構和實作選擇無需確認
遇到以下情況停止:
- 關鍵事實無法核實
- 官方資料存在會改變結論的衝突
- 任務必須擴大範圍才能完成
- 工具連續失敗兩次
- 操作會產生外部寫入或不可逆影響
```
這樣,模型可以在安全範圍內持續工作,又不會擅自越過重要邊界。
### 五、Prompt 完整範例
原始 prompt:
```plaintext
請深入分析這家公司最新一季財報,
判斷業績好不好,並給出投資建議。
```
問題很明顯:沒說研究哪家公司、「業績好不好」沒判斷標準、沒規定資料來源和截止日期、沒區分事實與推論與觀點、「投資建議」範圍過大、不知道最終結果該如何交付。
改寫後(完整 CROCC 範本):
```markdown
# Context
我要研究一家美股公司的最新季度業績。
目標讀者是了解基礎財務指標、但不是專業分析師的中文投資者。
研究資料截止日期為 2026-07-11。
# Request
分析該公司最新季度財報,並回答:
1. 收入、毛利率和營業利潤分別發生了什麼變化
2. 主要增長來自核心業務,還是一次性因素
3. 管理層對下一季度和全年的指引是否發生變化
4. 實際結果與市場預期存在哪些主要差異
5. 哪些因素可能改變當前判斷
完成標準:
- 關鍵數字來自公司財報、股東信或 Earnings Call
- 區分公司披露的事實、根據數據作出的推論和實踐判斷
- 說明仍無法確認的問題
- 不提供確定性的買入或賣出建議
- 不根據單個季度直接推斷長期趨勢
# Output Format
使用簡體中文 Markdown。
結構:
1. 一句話結論
2. 關鍵數據表
3. 業績增長驅動
4. 管理層指引
5. 主要風險
6. 仍需跟蹤的指標
控制在 2000 字以內。
# Constraints
- 優先使用公司官方財報、股東信、SEC 文件和 Earnings Call
- 所有時效性數據註明來源和報告期
- 不虛構市場預期、分析師觀點或財務數字
- 證據不足時明確標記「不確定」
- 不提供目標價和確定性交易建議
- 不擴展到與本季度業績無關的長期行業報告
# Checkpoint
普通內容取捨無需確認。
遇到以下情況停止並說明:
- 無法確認最新報告期
- 公司披露的數據互相衝突
- 缺少回答核心問題所需的財務文件
- 某項結論只能依賴未經核實的第三方數據
```
這份 prompt 沒有要求 AI 模擬分析師團隊,也沒有規定必須進行幾輪反思;它只是把真正影響結果的資訊寫清楚了:研究對象和目標讀者、需要回答的問題、怎樣才算完成、可以使用哪些資料、哪些結論不能隨便下、最終結果怎麼交付、證據不足時什麼時候停止。
### 六、不同任務,Prompt 應該寫多長
沒有一個固定長度適合所有任務,作者簡單分成四檔:
- **簡單任務**:只需要 Request + Output Format。例如「把下面這段中文改成自然的商務英文,保留原意,語氣專業但不要過度正式,只輸出改寫結果」——不需要角色、權限和 Checkpoint。
- **普通任務**:Context + Request + Output Format。例如「這段內容面向第一次使用 Codex 的中文使用者,請重寫成一篇 1000 字以內的入門說明……使用自然中文和 Markdown」。
- **複雜研究**:使用完整結構框架,因為複雜研究通常涉及:多個資料來源、當前事實、時間範圍、不確定性、複雜結論、明確的交付標準。
- **Agent 或 Codex**:在框架基礎上補充:允許使用的工具、可以直接執行的操作、必須確認的操作、允許修改的目錄、禁止修改的範圍、驗證命令、重試上限、最終報告內容。
Prompt 的長度應該跟著任務複雜度和風險增加,而不是為了顯得高級不斷變長。
### 七、Sol、Terra 和 Luna 怎麼選
OpenAI 將 Sol 定位為旗艦能力、Terra 用於平衡智慧與成本、Luna 面向高效高併發工作。API 中的 gpt-5.6 alias 當前會指向 gpt-5.6-sol。不知道怎麼選,可以先這樣判斷:任務困難、錯誤代價高 → 先用 Sol;大部分日常任務 → 先測試 Terra;任務簡單、數量很大 → 測試 Luna。**模型越強,不代表越適合所有任務**——如果 Luna 已經能穩定完成欄位抽取,換成 Sol 通常只會增加成本。
### 八、推理應該開多少
GPT-5.6 支援六檔推理:none、low、medium、high、xhigh、max。
- none/low:適合簡單問答、翻譯、分類、格式轉換、延遲敏感任務
- medium:適合大多數 coding、研究、分析和 agent 任務
- high/xhigh:適合複雜 debug、架構、多約束分析
- max:適合最困難、品質優先、且測試證明有收益的任務
OpenAI 建議把 medium 作為平衡起點、low 用於延遲敏感工作;只有測到明顯品質提升時,才使用 high 或 xhigh;max 應留給最困難、品質優先的任務。
### 九、Pro Mode 什麼時候值得用
Pro Mode 與 Reasoning Effort 是兩個不同設定:Reasoning Effort 決定當前模式下的推理強度,Pro Mode 會讓模型在返回最終答案前投入更多整體工作。它更適合:困難優化、高價值程式碼審查、深度分析、錯誤代價較高的任務、有明確 Eval 標準的任務。通常不適合預設用於:日常問答、高併發請求、延遲敏感任務、沒有清晰驗收標準的工作。OpenAI 建議,只有當任務確實困難、而且邊際品質提升會實際影響結果時,才開啟 Pro;Standard 與 Pro 應使用同一批真實任務比較完成率、證據、token、延遲和成本。Pro 可與 Sol、Terra 或 Luna 組合使用,也可獨立選擇 Reasoning Effort。
### 最後:自檢五問
GPT-5.6 不需要一種全新的「神級 prompt」,你真正需要調整的是 prompt 的重心。過去我們花很多篇幅規定模型應該怎樣工作;現在更有效的方式是把下面五件事說清楚:Context(完成任務必須知道什麼)、Request(最後要得到什麼、怎樣才算完成)、Output Format(最終結果如何交付)、Constraints(事實、範圍、權限和禁止事項)、Checkpoint(什麼時候可以繼續、什麼時候必須停止)。
下一次寫完 prompt,檢查五個問題:模型知道我要什麼嗎?模型知道怎樣才算完成嗎?模型知道哪些資訊不能猜嗎?模型知道哪些操作不能越界嗎?模型知道什麼時候應該停下來嗎?這五個問題都能回答清楚,這份 prompt 通常就已經夠用了。
## 總結與結論
- **核心洞見 1:GPT-5.6 把 prompt 工程從「過程控制」轉向「結果定義」**。模型已能判斷目標與工作量,舊式「角色+多輪反思+叮嚀」的隆重寫法過時;重心應放在「要什麼、怎樣算完成、哪些不能做、何時該停」。OpenAI 內部數據(Eval +10~15%、token −41~66%、成本 −33~67%)是最硬的佐證。
- **架構建議 2:CROCC(本文自訂詞)是四要素框架的中文實作版**。Context/Request/Output Format/Constraints/Checkpoint 五項,本質是 [[GPT-5.6 提示詞大師課]] 的 Outcome/Constraints/Evidence/Autonomy 中文重組——把 Outcome 拆成 Context+Request、把 Autonomy 細化為 Checkpoint、補上 Output Format。兩篇同源、可互補。
- **架構建議 3:prompt 長度依任務複雜度四檔伸縮**。簡單(R+O)/普通(C+R+O)/複雜研究(全框架)/Agent(再補工具+權限+驗證命令),打破「越長越專業」的迷思——長度應跟著複雜度與風險走。
- **架構建議 4:模型/推理/Pro 三軸以實測為準**。預設 Terra+medium;模型越強不代表越適合所有任務(Luna 能穩定做的就別上 Sol);Pro Mode 只在邊際品質提升實際影響結果時開,並用同一批真實任務做 Standard vs Pro 對照。
- **方法論提醒 5:用「自檢五問」取代模板崇拜**。與其追求固定模板,不如每次寫完 prompt 用五個問題自檢(要什麼/算完成/不能猜/不能越界/何時停)——這比背誦任何框架都更能逼出 prompt 的真實缺口。引用 CROCC 一詞時宜標明為作者自訂、非 OpenAI 官方命名。
Obsidian 整理
原始文章
Prompt工程
GPT-5.6 提示詞大師課 (Prompting Masterclass by OpenAI)
"GPT-5.6 更聰明也更省 token,所以你該寫更短的提示——只講清楚「要什麼結果、不能碰什麼、怎樣算完成、哪些可自行決定」,其餘交給模型。"
Top 5 Insights
**核心洞見 1:GPT-5.6 把「提示工程」從加法變成減法**。模型已能自行判斷目標與投入程度,舊打法(冗長系統提示、反覆叮嚀、強迫模板)從「有幫助」變成「可能有害」;OpenAI 內部評測的「+15% 評分、−60% token」是這個轉向最硬的證據。 **核心洞見 2:「重複警告」會反噬**。在提示中反覆寫「先詢問/不得修改/等待批准」,會讓模型對安全且預期的操作也停下來問——這解釋了許多人「模型怎麼變得那麼愛問」的困惑,解法是用一條清楚的授權邊界取代多條重複警告。 **架構建議 3:四要素 prompt 框架可直接套用**。Outcome/Constraints/Evidence/Autonomy 這四項,加上「回答類 vs 變更類」的授權分句,是一份能立刻貼進系統提示的範本;關鍵是把「教模型怎麼想」換成「告訴模型要什麼、不能碰什麼、怎樣算完成」。 **架構建議 4:模型/推理/Pro 三軸按任務調**。預設 Terra + Medium;只有任務明確困難時才升 Sol/High/xHigh/Max,且 Pro Mode 要獨立評估(邊際品質提升是否值額外成本)。Max 應保留為「最後手段」。 **營運提醒 5:注意成本與遷移地雷**。cache writes 以 1.25 倍計費會改變提示快取的經濟模型;GPT-5.4 於 7/23 退役、舊 5.5 prompt 可能無法乾淨遷移——這兩點決定了「現在就要動」的時程,而非「之後再說」。
閱讀全文
---
tags: [Prompt工程, GPT-5.6, OpenAI, AI工程, 模型指南]
date: 2026-07-13
read: false
source: "2026-07-13T095946+0800-GPT-5.6 Prompting Masterclass (by OpenAI).md"
original_title: "GPT-5.6 Prompting Masterclass (by OpenAI)"
---
# GPT-5.6 提示詞大師課 (Prompting Masterclass by OpenAI)

原始來源與檔名:2026-07-13T095946+0800-GPT-5.6 Prompting Masterclass (by OpenAI).md
---
## SOURCE | 資訊源評估
- **準確性**:高 — 本文為 @aiedge_ 對 OpenAI 官方 GPT-5.6 Model Guidance(developers.openai.com/api/docs/guides/latest-model)的轉譯整理,並附上官方原文連結供核驗;關鍵數據(提示詞變短→評分 +15%、token −60%)雖標註為「OpenAI 內部評測」,但屬官方單方面說法。
- **易理解性**:高 — 作者刻意把開發者文件改寫成「大白話版本」,結構清楚(變化/如何提示/新功能/框架/注意事項),附可直接套用的 prompt 模板。
- **閱讀策略建議**:先記住一個反直覺結論——「對 GPT-5.6,少即是多(less is more),過度工程化的提示詞反而有害」;再把第 IV 部分的「四要素 prompt 框架(Outcome / Constraints / Evidence / Autonomy)」與第 V 部分的「注意事項(cache writes 1.25x、GPT-5.4 七月退役)」當作落地清單;建議對照 OpenAI 官方原文核對數字。
## NAPKIN | 餐巾紙
### 餐巾紙公式
> 對 GPT-5.6:短提示 + 清楚授權邊界 + 具體指令 > 冗長的系統提示
_OpenAI 內部評測發現,把冗長明確的系統提示換成精簡提示,評分 +15%、token −60%;模型已能自行判斷目標與投入程度,過度工程化的提示反而觸發不必要的權限檢查。_
### 一句話
> GPT-5.6 更聰明也更省 token,所以你該寫更短的提示——只講清楚「要什麼結果、不能碰什麼、怎樣算完成、哪些可自行決定」,其餘交給模型。
### 餐巾紙草圖
```
┌──────────────────────────────────────────────
│ GPT-5.6 提示詞 — 新正規
│
│ 舊模型:提示要長、要詳盡、反覆叮嚀
│ ▼ (反向)
│ GPT-5.6:提示要短、邊界要清、指令要具體
│
│ 高品質 prompt 四要素:
│ ┌────────────────────────────
│ │ 1. Outcome 「完成」長什麼樣
│ │ 2. Constraints 審批邊界、不可碰、範圍
│ │ 3. Evidence 用什麼證據/格式確認正確
│ │ 4. Autonomy 不必先問即可做哪些
│ └────────────────────────────
│
│ 模型 Sol/Terra/Luna × 推理 6 檔 × Pro Mode
│ 預設:Terra + Medium,困難才升 Sol/High/Max
└──────────────────────────────────────────────
```
## ROUND 1: SKELETON | 骨架掃描
**「這篇文章在說什麼」**
- **核心問題**:面對新一代 GPT-5.6,要怎麼寫提示詞才能讓它發揮 10 倍效率?
- **核心答案**:GPT-5.6 更懂意圖、預設回答更短、token 更省,所以提示詞要反過來做「減法」——用更短的提示、用清楚的權限邊界取代反覆警告、用具體指令取代模糊要求;過度工程化的提示現在更可能幫倒忙。
- **論證結構**:演繹+清單型。先講模型變化(為什麼舊打法失效),再給「如何正確提示」的五條原則,接著列新功能,最後給一套可複用的 prompt 框架與注意事項。
### 章節骨架
1. **七大變化**:token 效率/懂意圖/回答更短/設計力/新推理/PTC/多智能體
2. **如何正確提示**:更短/定義授權/避免泛泛/語氣/輕量結構
3. **新功能**:Pro Mode/ChatGPT Work/GPT-Live/新推理強度/Hosted Sites
4. **最佳提示框架**:選模型→設推理→判 Pro→四要素建 prompt→再精簡
5. **注意事項**:cache 貴/PTC 適用時機/Pro 成本/Sites 即生產/5.4 退役/舊 prompt 遷移
## ROUND 2: DISSECTION | 血肉解剖
**「憑什麼這麼說」**
### 論證鏈
```
GPT-5.6 更懂意圖、預設更短、token 更省
▼
舊打法(冗長系統提示、反覆叮嚀)→ 多餘甚至有害
▼
實證:精簡提示 vs 冗長提示 → 評分 +15%、token −60%
▼
新原則:短提示 + 清楚授權邊界(取代反覆警告)+ 具體指令
▼
落地:四要素框架(Outcome/Constraints/Evidence/Autonomy)
▼
搭配:模型(Sol/Terra/Luna) × 推理(6檔) × Pro Mode 按任務選
```
### 關鍵證據
1. **+15% / −60% 的內部評測**:OpenAI 內部評測發現,把冗長明確的系統提示換成精簡提示,評分提升約 15%,同時總 token 減少 60% 以上——這是「提示要變短」最硬的證據。
2. **「重複警告會觸發不必要權限檢查」**:在提示中反覆寫「先詢問」「不得修改」「等待批准」,反而可能讓模型對安全且預期中的操作也停下來問——這解釋了「為什麼反覆叮嚀會幫倒忙」的機制。
3. **語氣指令失效的對照**:對 GPT-5.6 說「更友善」「更有同理心」幾乎沒有明顯改善;改成具體描述(「直接但得體、必要時具體指出阻礙、避免套話式安慰」)才有效——證明「具體 > 模糊」。
### 隱形假設與邊界
- **隱形假設**:
- OpenAI 的「+15%/−60%」內部評測結果,可類推到使用者的真實任務(實際上不同任務領域差異可能很大)。
- 使用者能準確寫出「Outcome/Constraints/Evidence/Autonomy」——但許多人最難的正是講清楚「完成長什麼樣」。
- **邊界條件(何時論點失效)**:
- 高合規、高風險場域(醫療、金融、法律)仍需要明確、詳盡的邊界聲明,「短提示」不能無條件套用。
- 「反覆叮嚀有害」的前提是模型真的懂上下文;若任務極度陌生或領域特殊,適度的明確指示仍必要。
- cache writes 改為 1.25 倍未快取輸入費率,代表對「首次寫入 cache」的使用者,成本結構變貴——短提示的省 token 紅利可能被 cache 成本部分抵銷。
## ROUND 3: SOUL | 靈魂提取
**「還能怎麼用」**
- **作者盲點**:通篇把「模型變聰明」當成既成事實,但「更懂意圖」的程度在不同任務上差異極大;作者也沒有提示「短提示」在少樣本(few-shot)或需要嚴格輸出格式的場景下可能不夠。此外,「+15%/−60%」是平均數,個別任務可能反向(變短反而變差),作者未提醒讀者自行做 A/B 驗證。
- **知識連接**:這與 [[GPT-5.6 提示詞大師課]] 相關的核心觀念——「prompt 即控制流的宣告,而非思考流程的劇本」——在 Agent 架構、Claude Code skill 設計、以及 Anthropic 對 Claude 系列的 prompt 指南中是同一條主線:把「教模型怎麼想」讓位給「告訴模型要什麼、不能做什麼」。
- **行動觸發**:把你現有最長的那支系統提示,做一次「刪減實驗」——刪一類重複規則→跑測試→刪無效範例→再跑→縮短工具說明→再比對,每次只改一類,找出真正有貢獻的部分。
### 留白提問(Guided Reflection)
- 如果「反覆叮嚀模型要小心」反而會讓它在安全操作前也停下來問你,那麼你過去寫的那些「嚴禁…務必…不可…」,究竟是在保護結果,還是在安撫你自己的焦慮?
- 當模型強到「你只要說清目標與邊界,它自己會找路」,你作為使用者的核心價值,是會從「會寫很長的提示」轉移到「能講清楚成功的定義」嗎?後者其實是更難的能力。
### 跨域映射
- 在 **Prompt 工程**,這叫 **宣告式優於命令式提示(declarative over imperative prompting)**。
- 在 **Agent 架構**,這對應 **授權邊界/autonomy policy 的顯式宣告**。
- 在 **專案管理**,這等同 **定義「完成」(Definition of Done)勝過微觀管理執行步驟**。
## DEEP READ | 精讀指引
> [!IMPORTANT]
> 學習的本質需要「認知阻力」。請親自回到原文閱讀以下核心段落,感受原始論述的阻力,不要只依賴 AI 的總結。
1. **第 II 部分「Use Shorter Prompts」**:原文給出「+15% 評分、−60% token」的內部評測數字,這是整篇「提示要做減法」主張的硬支點;建議同時回 OpenAI 官方文件核對這組數字的適用範圍。
2. **第 IV 部分「Build the Prompt」四要素模板**:Outcome / Constraints / Evidence / Autonomy 的組合,附了一段可直接套用的 prompt 原文(含「回答類 vs 變更類」的授權分句),這是全文最值得複製到自己範本庫的實體。
3. **第 V 部分「Caveats」**:cache writes 1.25 倍計費、PTC 不是萬靈丹、Pro Mode 更貴、Sites 部署網址即生產、GPT-5.4 七月 23 日退役、舊 5.5 prompt 可能無法乾淨遷移——這六條是「知道才不會踩雷」的營運細節,讀原文能感受到每一條背後都是真實的帳單與遷移痛。
## STRUCTURE MAP | 全書結構圖
```
┌──────────────────────────────────────────────
│ GPT-5.6 提示詞大師課 — 結構
│
│ I. 模型變化(為何舊打法失效)
│ ├ token 效率↑ / 懂意圖↑ / 回答預設更短
│ ├ 設計與前端判斷↑
│ ├ 新推理 max + Pro Mode
│ ├ Programmatic Tool Calling (PTC)
│ └ 多智能體協作 (beta)
│ ▼
│ II. 如何正確提示(五原則)
│ ├ 1. 用更短的提示 ← 最大調整
│ ├ 2. 清楚定義自主權與權限(勿重複警告)
│ ├ 3. 避免泛泛指令(用具體優先級)
│ ├ 4. 語氣要具體,別說「更友善」
│ └ 5. 結構輕量化
│ ▼
│ III. 新功能:Pro Mode / Work / GPT-Live / 6檔推理 / Sites
│ ▼
│ IV. 最佳框架:選模型 → 設推理 → 判 Pro → 四要素 → 再精簡
│ 四要素 = Outcome + Constraints + Evidence + Autonomy
│ ▼
│ V. 注意事項:cache 1.25x / PC 慎用 / Pro 貴 / Sites 即生產
│ / 5.4 7/23 退役 / 舊 prompt 需重寫
└──────────────────────────────────────────────
```
---
# GPT-5.6 提示詞大師課 (Prompting Masterclass by OpenAI) (Architectural Deep Dive)
## 前言/背景
本文是 @aiedge_ 對 OpenAI 官方《GPT-5.6 Model Guidance》的白話轉譯,要解決的核心問題是:**新一代 GPT-5.6 模型家族在行為上發生了根本變化(更懂意圖、預設更短、token 更省),因此沿用舊模型「寫長、寫詳盡、反覆叮嚀」的提示打法,不但不再帶來收益,反而可能傷害表現。** 文章給出一套「做減法」的新提示正規、一套可複用的四要素 prompt 框架,以及一系列營運層級的注意事項。
## 章節詳細總結
### I:GPT-5.6 有哪些變化
在動任何提示詞之前,先理解模型的根本性變化:
1. **token 效率顯著提高**:GPT-5.6 用比以往更少的輸出 token,就能達到前沿(frontier)水準的效能。
2. **更懂你的意圖**:即使你不把每一步都寫清楚,GPT-5.6 也能推斷出你的真正目標,以及完成任務所需投入的合理程度。你仍須明確說明限制條件、授權邊界與成功標準,但不再需要事無鉅細地引導。
3. **預設回答更短**:這是最大的行為變化之一。GPT-5.6 整體回答比以往更短——通用式開場更少、推測性分支更少、列表更精簡、答案與其推理之間的重複更少。
4. **設計與前端判斷力增強**:能產出更精緻、實用的網站與應用,在布局、視覺層級與設計判斷上明顯提升。
5. **新的推理與執行模式**:新增 **max** 推理強度(在 xhigh 之上),適合最困難的任務;並推出全新的 **Pro Mode**。
6. **工具呼叫有了新的執行路徑**:GPT-5.6 可以自行撰寫並執行輕量級程式,用來呼叫工具、處理結果、過濾中間輸出,這稱為**程式化工具呼叫(Programmatic Tool Calling, PTC)**。
7. **多智能體協作(beta)**:單一個 GPT-5.6 實例現在可以平行協調多個子智能體並整合結果,類似 Codex 的 ultra 模式。

### II:如何正確地為 GPT-5.6 撰寫提示詞
1. **使用更短的提示詞**——這是你最需要做出的調整。OpenAI 內部評測發現,用精簡提示取代冗長明確的系統提示,評分提高約 **15%**,同時總 token 減少 **60% 以上**。
2. **明確定義自主權與權限**——GPT-5.6 可以主動且持續地推進任務,因此你要清楚說明希望模型在哪裡停止、實際有權執行哪些操作。
- **重要提醒**:不要在提示中反覆寫「先詢問」「不得修改」「等待批准」。重複反而會觸發不必要的權限確認,即使是安全且預期中的操作,模型也可能停下來問。
3. **避免泛泛的指令**——改用能體現優先級的指令,讓模型明白你的核心目標。
- **範例**:希望回答更短,不要說「簡短一點」,而要說「先給出結論」。
4. **語氣**——告訴 GPT-5.6「更友善」「更有同理心」不會帶來明顯改善;這類泛泛的親和力指令已不像舊模型那樣有效。改成具體描述:
```text
"Be direct and tactful. Acknowledge friction specifically when relevant. Avoid canned reassurance and unnecessary sign-offs."
(直接但得體。必要時具體指出問題帶來的阻礙。避免套話式安慰與多餘的結語。)
```
5. **保持輕量化結構**——GPT-5.6 適合少量且針對具體任務的結構(一個輕量級大綱),而不是強迫每次回答都遵循完整模板。只有當你自己的測試證明某項約束確實必要時,才加入。
> **太長不看版**:對 GPT-5.6 來說,少即是多。提示要更短、用清楚的權限邊界取代反覆警告、用具體要求取代模糊指令。如今,過度工程化提示詞更可能帶來負面效果。
### III:新功能
1. **Pro Mode**:適用於任何 GPT-5.6 模型(Sol、Terra、Luna)與其支援的任一推理強度。你不需要切換到單獨的「Pro」模型,只要保留現有模型選擇、在上面疊加 Pro Mode 設定即可。
2. **ChatGPT Work**:OpenAI 直接對標 Claude Cowork 的產品。Work 模式獨立於一般 ChatGPT 對話,用來自動化你所在行業的真實工作流程。

3. **GPT-Live**:OpenAI 新一代進階語音提示,支援更流暢的對話、即時語言翻譯等。

4. **新的推理強度**:GPT-5.6 支援六檔——None、Low、Medium、High、xHigh、Max。新增的是 **Max**,位於 xhigh 之上,適合最複雜的任務。可在 ChatGPT 的模型選擇器中直接調整。
5. **Hosted Sites(託管站點)**:分享想法的新方式,透過網頁版 ChatGPT Work、或桌面應用的 Work/Codex 模式使用。
### IV:GPT-5.6 的最佳提示框架
綜合上述原則,適用於大多數提示的框架:
**第 1 步:選模型**——三個等級:
- **Sol**:用於最困難的任務
- **Terra**:日常主力
- **Luna**:最快最便宜,為高吞吐工作負載打造
**第 2 步:設推理強度**:
- None/Low:基礎提示
- Medium:預設(涉及 MCP 呼叫、API 呼叫等)
- High/xHigh:複雜任務
- Max:最後手段(極度複雜的工作)
**第 3 步:判斷是否需要 Pro Mode**——獨立於推理強度,只在品質的邊際提升確實重要時使用。
**第 4 步:建構提示**——每條高品質 GPT-5.6 prompt 有四個組成:
1. **Outcome(結果)**:完成實際長什麼樣
2. **Constraints(約束)**:審批邊界、不可發生的事、範圍
3. **Evidence/success criteria(證據/成功標準)**:用什麼證據或格式確認正確
4. **Autonomy policy(自主權策略)**:模型可不必先問就做哪些事
組合起來如下:
```text
"Goal: [the outcome you actually want, stated plainly]
For requests to answer, explain, review, or plan: inspect the relevant materials and report the result. Do not implement changes unless requested.
For requests to change or build: make the requested in-scope changes and run relevant non-destructive validation without asking first. Require confirmation only for external writes, destructive actions, or a material scope change.
Success criteria: [how you or the model will know it's actually done]
Output format: [exactly how you want it delivered]"
```
**第 5 步:保持簡短**——prompt 建好後,再精簡,刪掉所有不是 100% 必要的部分。
### V:使用 GPT-5.6 的注意事項
- **cache 寫入現在更貴**:以未快取輸入費率的 **1.25 倍** 計費。
- **PTC 不見得總是對的選擇**:一次呼叫就夠時,就別用。
- **Pro Mode 成本更高**:所有額外背景工作都按標準 token 費率計費。
- Sites 的**部署網址永遠是生產環境**:預設沒有單獨的預發步驟;想在上線前審閱,請先存一個版本。
- **GPT-5.4 將於 7 月 23 日退役**:GPT-5.5 仍可用;最好現在就遷移,不要等。
- **舊的 GPT-5.5 prompt 可能無法乾淨遷移**:可請 GPT-5.6 重寫你的工作流程,讓新的 5.6 系列更有效率地運作。
## 總結與結論
- **核心洞見 1:GPT-5.6 把「提示工程」從加法變成減法**。模型已能自行判斷目標與投入程度,舊打法(冗長系統提示、反覆叮嚀、強迫模板)從「有幫助」變成「可能有害」;OpenAI 內部評測的「+15% 評分、−60% token」是這個轉向最硬的證據。
- **核心洞見 2:「重複警告」會反噬**。在提示中反覆寫「先詢問/不得修改/等待批准」,會讓模型對安全且預期的操作也停下來問——這解釋了許多人「模型怎麼變得那麼愛問」的困惑,解法是用一條清楚的授權邊界取代多條重複警告。
- **架構建議 3:四要素 prompt 框架可直接套用**。Outcome/Constraints/Evidence/Autonomy 這四項,加上「回答類 vs 變更類」的授權分句,是一份能立刻貼進系統提示的範本;關鍵是把「教模型怎麼想」換成「告訴模型要什麼、不能碰什麼、怎樣算完成」。
- **架構建議 4:模型/推理/Pro 三軸按任務調**。預設 Terra + Medium;只有任務明確困難時才升 Sol/High/xHigh/Max,且 Pro Mode 要獨立評估(邊際品質提升是否值額外成本)。Max 應保留為「最後手段」。
- **營運提醒 5:注意成本與遷移地雷**。cache writes 以 1.25 倍計費會改變提示快取的經濟模型;GPT-5.4 於 7/23 退役、舊 5.5 prompt 可能無法乾淨遷移——這兩點決定了「現在就要動」的時程,而非「之後再說」。
Obsidian 整理
原始文章
Prompt工程
GPT-5.6 提示詞大師課(OpenAI 出品)
"GPT-5.6 更懂意圖也更省 token,所以提示要做減法——只講清楚「結果、約束、證據、自主權」,過度設計的提示現在更可能幫倒忙。"
Top 5 Insights
**核心洞見 1:GPT-5.6 把提示工程從加法變成減法**。模型已能自行判斷目標與工作量,舊打法(冗長系統提示、反覆叮嚀、強迫模板)從「有幫助」變成「可能有害」;OpenAI 內部評測的「+15% 評分、−60% token」是這個轉向最硬的證據。 **核心洞見 2:「重複警告」會反噬**。在提示中反覆寫「先詢問/不得修改/等待批准」,會讓模型對安全且預期的操作也停下來問——這解釋了許多人「模型怎麼變得那麼愛問」的困惑;解法是用一條清楚的授權邊界取代多條重複警告。 **架構建議 3:四要素 prompt 框架可直接套用**。結果/約束/證據/自主權四項,加上「回答類 vs 變更類」的授權分句,是一份能立刻貼進系統提示的範本;關鍵是把「教模型怎麼想」換成「告訴模型要什麼、不能碰什麼、怎樣算完成」。 **架構建議 4:模型/推理/Pro 三軸按任務調**。預設 Terra + Medium;任務明確困難時才升 Sol/High/xHigh/Max,且 Pro 模式要獨立評估(邊際品質提升是否值額外成本)。Max 應保留為「最後手段」。 **營運提醒 5:注意成本與遷移地雷**。cache 寫入以 1.25 倍計費會改變提示快取的經濟模型;GPT-5.4 於 7/23 退役、舊 5.5 prompt 可能無法順利遷移——這兩點決定了「現在就要動」的時程,而非「之後再說」。
閱讀全文
---
tags: [Prompt工程, GPT-5.6, OpenAI, AI工程, 模型指南]
date: 2026-07-13
read: false
source: "2026-07-13T095937+0800-GPT-5.6 提示词大师课(OpenAI 出品).md"
original_title: "GPT-5.6 提示词大师课(OpenAI 出品)"
---
# GPT-5.6 提示詞大師課(OpenAI 出品)

原始來源與檔名:2026-07-13T095937+0800-GPT-5.6 提示词大师课(OpenAI 出品).md
> [!info] 與同源文章的關係
> 本文為 @ai_suxiaole 對 @aiedge_ 英文版的**簡中譯本**,兩者同源於 OpenAI 官方《GPT-5.6 Model Guidance》。本報告將其視為**獨立文章**分析(不同作者框架、不同語言受眾、不同封面與配圖)。英文正典的深度拆解見 [[20260713_GPT-5.6 Prompting Masterclass (by OpenAI)]];另一份不同作者的中文重組(CROCC 框架)見 [[20260713_GPT-5.6 Prompt 到底該怎麼寫?OpenAI 官方指南,一篇講透!]]。
---
## SOURCE | 資訊源評估
- **準確性**:中高 — 譯者 @ai_suxiaole(XWise 插件作者)忠實翻譯 @aiedge_ 的英文版,並附上 OpenAI 官方原文連結(developers.openai.com/api/docs/guides/latest-model)與原始推文連結供核驗;關鍵數字(評分 +15%、token −60%、cache 1.25 倍)與英文版完全一致,屬可靠的二手轉譯。須留意:相較英文正本,譯本多了一層「譯者→原文」的轉手,極少數語意可能因翻譯而微調。
- **易理解性**:高 — 全篇簡體中文,結構與英文版對應(變化/如何提示/新功能/框架/注意事項),對中文母語者門檻低於英文正本;譯者也保留了原文的程式碼區塊與語氣範例。
- **閱讀策略建議**:把它當「英文正本的中文對照版」——若已讀 [[20260713_GPT-5.6 Prompting Masterclass (by OpenAI)]],可快速掃過重點;若偏好中文閱讀,則以此篇為主、英文版為輔。核心收斂與英文版一致:對 GPT-5.6「少即是多」,過度工程化的提示反有害。
## NAPKIN | 餐巾紙
### 餐巾紙公式
> 對 GPT-5.6:更短的提示 + 清楚的權限邊界 + 具體指令 > 冗長明確的系統提示
_OpenAI 內部評測:用精簡提示取代冗長系統提示,評分 +15%、總 token −60%;模型已能推斷目標與工作量,重複的「先詢問/不得修改/等待批准」反而觸發不必要的權限確認。_
### 一句話
> GPT-5.6 更懂意圖也更省 token,所以提示要做減法——只講清楚「結果、約束、證據、自主權」,過度設計的提示現在更可能幫倒忙。
### 餐巾紙草圖
```
┌──────────────────────────────────────────────
│ GPT-5.6 提示詞(中譯本)— 新正規
│
│ 舊模型:提示要長、要詳盡、反覆叮嚀
│ ▼ (反向)
│ GPT-5.6:提示要短、邊界要清、指令要具體
│
│ 高品質 prompt 四要素(譯自英文正本):
│ ┌────────────────────────────
│ │ 1. 結果 (Outcome) 「完成」具體是什麼樣
│ │ 2. 約束 (Constraints) 審批邊界、禁止、範圍
│ │ 3. 證據 (Evidence) 用什麼確認正確
│ │ 4. 自主權 (Autonomy) 不必先問可做哪些
│ └────────────────────────────
│
│ 模型 Sol/Terra/Luna × 推理 6 檔 × Pro Mode
│ 預設:Terra + Medium,困難才升 Sol/High/Max
└──────────────────────────────────────────────
```
## ROUND 1: SKELETON | 骨架掃描
**「這篇文章在說什麼」**
- **核心問題**:面對 GPT-5.6,要怎麼寫提示詞才能讓它能力與效率提升 10 倍?
- **核心答案**:GPT-5.6 更懂意圖、預設回答更短、token 更省,所以提示要反過來「做減法」——用更短的提示、用清楚的權限邊界取代反覆警告、用具體要求取代模糊指令;過度設計提示詞如今更可能帶來負面效果。
- **論證結構**:演繹+清單型。先講模型七大變化,再給五條正確提示原則,接著列新功能,最後給最佳框架與注意事項。
### 章節骨架
1. **七大變化**:token 效率/懂意圖/回答更短/設計力/新推理/PTC/多智能體
2. **如何正確提示**:更短/定義權限/避免泛泛/語氣/輕量結構
3. **新功能**:Pro 模式/ChatGPT Work/GPT-Live/新推理強度/Hosted Sites
4. **最佳提示框架**:選模型→設推理→判 Pro→四要素建 prompt→再精簡
5. **注意事項**:cache 貴/PTC 適用時機/Pro 成本/Sites 即生產/5.4 退役/舊 prompt 遷移
## ROUND 2: DISSECTION | 血肉解剖
**「憑什麼這麼說」**
### 論證鏈
```
GPT-5.6 更懂意圖、預設更短、token 更省
▼
舊打法(冗長系統提示、反覆叮嚀)→ 多餘甚至有害
▼
實證:精簡 vs 冗長 → 評分 +15%、token −60%
▼
新原則:短提示 + 清楚權限邊界(取代反覆警告)+ 具體指令
▼
落地:四要素框架(結果/約束/證據/自主權)
▼
搭配:模型(Sol/Terra/Luna) × 推理(6檔) × Pro 模式 按任務選
```
### 關鍵證據
1. **+15% / −60% 的內部評測**:OpenAI 內部評測發現,用精簡提示替換冗長明確的系統提示,評分提高約 15%,總 token 減少 60% 以上——「提示要做減法」最硬的證據。
2. **重複警告觸發權限確認**:在提示中反覆寫「先詢問」「不得修改」「等待批准」,反而可能讓模型對安全且預期中的操作也停下來問——解釋了「為什麼反覆叮嚀會幫倒忙」的機制。
3. **語氣指令失效對照**:對 GPT-5.6 說「更友善」「更有同理心」幾乎沒有明顯改善;改成具體描述(「直接但得體、必要時具體指出阻礙、避免套話式安慰」)才有效——證明「具體 > 模糊」。
### 隱形假設與邊界
- **隱形假設**:
- OpenAI 的「+15%/−60%」內部評測可類推到使用者真實任務(不同領域差異可能很大)。
- 使用者能準確寫出四要素,但多數人最難的正是講清楚「完成具體是什麼樣」。
- 譯本假設讀者能自行校正簡繁用語差異(如「提示詞」vs「prompt」)。
- **邊界條件(何時論點失效)**:
- 高合規、高風險場域(醫療、金融、法律)仍需明確詳盡的邊界聲明,「短提示」不能無條件套用。
- 「反覆叮嚀有害」的前提是模型真的懂上下文;任務極度陌生或領域特殊時,適度明確指示仍必要。
- cache 寫入以 1.25 倍計費,短提示的省 token 紅利可能被 cache 成本部分抵銷。
## ROUND 3: SOUL | 靈魂提取
**「還能怎麼用」**
- **作者(譯者)盲點**:譯本 faithfully 跟隨英文正本,因此繼承了正本的盲點——把「模型變聰明」當既成事實、未提醒「短提示」在少樣本或嚴格輸出格式場景可能不夠、未提示讀者自行做 A/B 驗證。譯者本身也未對「+15%/−60%」是平均值、個別任務可能反向這一點加註。
- **知識連接**:與同源三篇構成 GPT-5.6 提示詞的完整圖譜——本文(中譯)為入門中文讀者而譯,[[20260713_GPT-5.6 Prompting Masterclass (by OpenAI)]] 為英文正典,[[20260713_GPT-5.6 Prompt 到底該怎麼寫?OpenAI 官方指南,一篇講透!]] 為不同作者的中文重組(CROCC)。核心觀念「宣告式優於命令式提示」是三者共同主軸。
- **行動觸發**:把你現有最長的那支系統提示做「刪減實驗」——刪一類重複規則→跑測試→刪無效範例→再跑→縮短工具說明→再比對,每次只改一類,找出真正有貢獻的部分。
### 留白提問(Guided Reflection)
- 如果「反覆叮嚀模型要小心」反而讓它在安全操作前也停下來問你,那你過去寫的那些「嚴禁…務必…不可…」,究竟是在保護結果,還是在安撫自己的焦慮?
- 當模型強到「你只要說清目標與邊界,它自己會找路」,你作為使用者的核心價值,會從「會寫很長的提示」轉移到「能講清楚成功的定義」嗎?後者其實是更難的能力。
### 跨域映射
- 在 **Prompt 工程**,這叫 **宣告式優於命令式提示(declarative over imperative prompting)**。
- 在 **Agent 架構**,這對應 **授權邊界/autonomy policy 的顯式宣告**。
- 在 **專案管理**,這等同 **定義「完成」(Definition of Done)勝過微觀管理執行步驟**。
## DEEP READ | 精讀指引
> [!IMPORTANT]
> 學習的本質需要「認知阻力」。請親自回到原文閱讀以下核心段落,感受原始論述的阻力,不要只依賴 AI 的總結。
1. **「二、如何正確地為 GPT-5.6 撰寫提示詞」第 1 點「使用更短的提示詞」**:原文給出「評分 +15%、token −60%」的 OpenAI 內部評測數字,是整篇「提示要做減法」主張的硬支點;建議同時回 OpenAI 官方文件核對適用範圍。
2. **「四、GPT-5.6 最優提示框架」第 4 步「構建提示詞」四要素+程式碼區塊**:結果/約束/證據/自主權四項,附一段可直接套用的 prompt 原文(含「回答類 vs 變更類」的授權分句),是全文最值得複製到自己範本庫的實體。
3. **「五、使用 GPT-5.6 時的注意事項」**:cache 寫入 1.25 倍計費、PTC 不是萬靈丹、Pro 模式成本更高、Sites 部署網址即生產、GPT-5.4 七月 23 日退役、舊 5.5 prompt 可能無法順利遷移——六條「知道才不會踩雷」的營運細節。
## STRUCTURE MAP | 全書結構圖
```
┌──────────────────────────────────────────────
│ GPT-5.6 提示詞大師課(中譯本)— 結構
│
│ 一、模型變化(為何舊打法失效)
│ ├ token 效率↑ / 懂意圖↑ / 回答預設更短
│ ├ 設計與前端判斷↑
│ ├ 新推理 max + Pro 模式
│ ├ 程式化工具呼叫 (PTC)
│ └ 多智能體協作 (beta)
│ ▼
│ 二、如何正確提示(五原則)
│ ├ 1. 用更短的提示 ← 最大調整
│ ├ 2. 明確定義自主權與權限(勿重複警告)
│ ├ 3. 避免泛泛指令(用具體優先級)
│ ├ 4. 語氣要具體,別說「更友善」
│ └ 5. 結構輕量化
│ ▼
│ 三、新功能:Pro 模式 / Work / GPT-Live / 6檔推理 / Sites
│ ▼
│ 四、最佳框架:選模型 → 設推理 → 判 Pro → 四要素 → 再精簡
│ 四要素 = 結果 + 約束 + 證據 + 自主權
│ ▼
│ 五、注意事項:cache 1.25x / PTC 慎用 / Pro 貴 / Sites 即生產
│ / 5.4 7/23 退役 / 舊 prompt 需重寫
└──────────────────────────────────────────────
```
---
# GPT-5.6 提示詞大師課(OpenAI 出品)(Architectural Deep Dive)
## 前言/背景
本文是 @ai_suxiaole 對 @aiedge_ 英文版的簡中譯本,要解決的核心問題與英文正本一致:**新一代 GPT-5.6 模型家族在行為上發生了根本變化(更懂意圖、預設更短、token 更省),沿用舊模型「寫長、寫詳盡、反覆叮嚀」的提示打法,不但不再帶來收益,反而可能傷害表現。** 譯者以中文讀者為對象,把這套「做減法」的新提示正規、四要素 prompt 框架與營運注意事項完整中文化,讓不必啃英文開發者文件的讀者也能一次調對、不返工。
## 章節詳細總結
### 一、GPT-5.6 有哪些變化
在寫任何提示詞之前,先了解 GPT-5.6 的根本性變化:
1. **token 效率顯著提高**:GPT-5.6 用比以往更少的輸出 token,就能達到前沿水準的效能。
2. **更懂你的意圖**:即使你沒把每一個步驟都寫清楚,GPT-5.6 也能推斷出你的真正目標,以及完成任務所需投入的合理程度。你仍須明確說明限制條件、授權邊界與成功標準,但不再需要事無鉅細地引導。
3. **預設回答更短**:這是最明顯的行為變化之一。GPT-5.6 的回答比以往更短:通用式開場更少、推測性分支更少、列表更精簡、答案與推理之間的重複也更少。
4. **設計與前端判斷力增強**:能生成更精緻、實用的網站與應用,在布局、視覺層級與設計判斷上都有明顯提升。
5. **新的推理與執行模式**:新增 **max** 推理強度(比 xhigh 更高),適合最困難的任務;並推出全新的 **Pro 模式**。
6. **工具呼叫有了新的執行路徑**:GPT-5.6 可以自行撰寫並執行輕量級程式,用來呼叫工具、處理結果、過濾中間輸出,稱為**程式化工具呼叫(Programmatic Tool Calling, PTC)**。
7. **多智能體協作(測試版)**:一個 GPT-5.6 實例現在可以平行協調多個子智能體並整合結果,類似 Codex 的 Ultra 模式。

### 二、如何正確地為 GPT-5.6 撰寫提示詞
1. **使用更短的提示詞**——這是你最需要做出的調整。OpenAI 內部評測發現,用精簡提示替換冗長明確的系統提示,評分提高約 **15%**,總 token 減少 **60% 以上**。
2. **明確定義自主權與權限**——GPT-5.6 可以主動且持續地推進任務,因此你要清楚說明希望模型在哪裡停止、實際有權執行哪些操作。
- **一個重要提醒**:不要在提示中反覆寫「先詢問」「不得修改」「等待批准」。重複反而可能觸發不必要的權限確認,即使面對安全且符合預期的操作,模型也可能停下來詢問。
3. **避免泛泛的指令**——改用能體現優先級的指令,讓模型明白你的核心目標。
- **範例**:希望回答更短,不要只說「簡短一點」,而應該說「先給出結論」。
4. **語氣**——告訴 GPT-5.6「更友善一些」或「更有同理心」並不會帶來明顯改善;這類泛泛的親和力指令已不像舊模型那樣有效。改成具體要求:
```text
「直接但得體。必要時具體指出問題帶來的阻礙。避免套話式安慰和多餘的結束語。」
```
5. **保持輕量化結構**——GPT-5.6 適合少量且針對具體任務的結構(一個輕量級提綱),而不是強迫每次回答都遵循完整模板。只有當你自己的測試證明某項約束確實必要時,才加入。
> **太長不看版**:對 GPT-5.6 來說,少即是多。提示詞要更短、用清晰的權限邊界替代反覆警告、用具體要求替代模糊指令。如今,過度設計提示詞更可能帶來負面效果,而不是幫助。
### 三、新功能
1. **Pro 模式**:適用於任何 GPT-5.6 模型(Sol、Terra、Luna)與這些模型支援的任意推理強度。你不需要切換到單獨的「Pro」模型,只需保留現有模型選擇、在此基礎上開啟 Pro 模式。
2. **ChatGPT Work**:OpenAI 針對 Claude Cowork 推出的直接競品。Work 模式獨立於普通 ChatGPT 對話,主要用於自動化處理你所在行業的真實工作流程。

3. **GPT-Live**:OpenAI 推出的新一代高級語音交互功能,支援更流暢的對話、即時語言翻譯等能力。
4. **新的推理強度**:GPT-5.6 現在支援六檔推理強度:None、Low、Medium、High、xHigh 和 Max。新增的是 **Max**,位於 xHigh 之上,適合最複雜的任務。可直接在 ChatGPT 的模型選擇器中調整。
5. **託管站點(Hosted Sites)**:一種分享想法的新方式,可透過網頁版 ChatGPT Work、或 ChatGPT 桌面應用中的 Work/Codex 模式使用。
### 四、GPT-5.6 最優提示框架
這套框架適用於大多數提示詞,綜合了前文全部原則:
**第 1 步:選擇模型**——三個級別:
- **Sol**:用於最困難的任務
- **Terra**:適合作為日常主力模型
- **Luna**:速度最快、價格最低,專為高吞吐量工作負載打造
**第 2 步:設置推理強度**:
- None/Low:基礎提示任務
- Medium:預設選擇(適用於涉及 MCP 呼叫、API 呼叫等操作)
- High 或 xHigh:複雜任務
- Max:最後手段(僅用於極其複雜的工作)
**第 3 步:判斷是否需要 Pro 模式**——獨立於推理強度,只在質量上的微小提升確實具有實際價值時使用。
**第 4 步:構建提示詞**——每條高質量的 GPT-5.6 提示詞都包含四個部分:
1. **結果**:任務完成時具體應該是什麼樣子
2. **約束**:審批邊界、禁止事項和任務範圍
3. **證據/成功標準**:用什麼證據或格式確認結果正確
4. **自主權策略**:模型無需事先詢問即可執行哪些操作
組合起來如下:
```text
「目標:[用直白的語言說明你真正想要的結果]
對於回答、解釋、審查或規劃類請求:檢查相關材料並彙報結果。除非明確要求,否則不要實施更改。
對於修改或構建類請求:在不事先詢問的情況下,完成請求範圍內的更改,並執行相關的非破壞性驗證。只有涉及外部寫入、破壞性操作或重大範圍變更時,才需要請求確認。
成功標準:[你或模型如何判斷任務確實已經完成]
輸出格式:[明確說明你希望結果以什麼形式交付]」
```
**第 5 步:保持簡短**——提示詞寫好後,再精簡一遍,刪除所有不是絕對必要的內容。
### 五、使用 GPT-5.6 時的注意事項
- **緩存寫入現在更貴**:費用按未緩存輸入價格的 **1.25 倍** 計算。
- **PTC 並不總是正確選擇**:如果一次工具呼叫就能完成任務,就不要使用它。
- **Pro 模式成本更高**:所有額外的後台工作都會按標準 token 費率計費。
- Sites 的**部署網址始終是生產環境地址**:預設沒有單獨的預發布環節;若想在正式上線前審閱,請先保存一個版本。
- **GPT-5.4 將於 7 月 23 日退役**:GPT-5.5 會繼續提供,最好現在就遷移,不要等到最後一刻。
- **舊版 GPT-5.5 提示詞可能無法順利遷移**:可讓 GPT-5.6 重寫你的工作流程,讓新的 5.6 系列模型以更高效率工作。
## 總結與結論
- **核心洞見 1:GPT-5.6 把提示工程從加法變成減法**。模型已能自行判斷目標與工作量,舊打法(冗長系統提示、反覆叮嚀、強迫模板)從「有幫助」變成「可能有害」;OpenAI 內部評測的「+15% 評分、−60% token」是這個轉向最硬的證據。
- **核心洞見 2:「重複警告」會反噬**。在提示中反覆寫「先詢問/不得修改/等待批准」,會讓模型對安全且預期的操作也停下來問——這解釋了許多人「模型怎麼變得那麼愛問」的困惑;解法是用一條清楚的授權邊界取代多條重複警告。
- **架構建議 3:四要素 prompt 框架可直接套用**。結果/約束/證據/自主權四項,加上「回答類 vs 變更類」的授權分句,是一份能立刻貼進系統提示的範本;關鍵是把「教模型怎麼想」換成「告訴模型要什麼、不能碰什麼、怎樣算完成」。
- **架構建議 4:模型/推理/Pro 三軸按任務調**。預設 Terra + Medium;任務明確困難時才升 Sol/High/xHigh/Max,且 Pro 模式要獨立評估(邊際品質提升是否值額外成本)。Max 應保留為「最後手段」。
- **營運提醒 5:注意成本與遷移地雷**。cache 寫入以 1.25 倍計費會改變提示快取的經濟模型;GPT-5.4 於 7/23 退役、舊 5.5 prompt 可能無法順利遷移——這兩點決定了「現在就要動」的時程,而非「之後再說」。
- **譯本定位 6**:本文為 [[20260713_GPT-5.6 Prompting Masterclass (by OpenAI)]] 的中文對照版,技術內容一致、語言受眾不同;中文讀者可擇一為主、另一為輔,兩者搭配 [[20260713_GPT-5.6 Prompt 到底該怎麼寫?OpenAI 官方指南,一篇講透!]] 的 CROCC 框架,即構成 GPT-5.6 提示詞的完整中文資產。
Obsidian 整理
原始文章