Gary
Hsieh
2026 · taipeiloading
回到文章列表
AI 趨勢軟體工程2026-08-08

ChatGPT、Work、codex 到底差在哪?

ChatGPT、Work、codex 到底差在哪?

ChatGPT、Work、codex 到底差在哪?

  • 同一句指令,為什麼在 chat 裡它只會講話,在 codex 裡它會操作檔案?
  • 它到底碰得到我哪些檔案?能不能操作我的瀏覽器?
  • 我該用哪一個?
  • 權限在哪裡設?我怎麼知道它現在能做什麼、不能做什麼?

這半年,這三個東西被塞進同一個 app 之後,我也是看得灰薩薩...

花了一些時間研究他們的能力邊界後,我整理一個四層思考模型:大腦 + 記憶 + 工具 + 權限

agent = brain + context + tools + permissions

一個能工作的 agent,基礎是這四個東西的組合:

  • brain — 大腦。LLM 本體。它多聰明。
  • context — 上下文、記憶。它知道什麼。你的知識、Project、Memory。
  • tool — 工具。它碰得到什麼。瀏覽器、檔案、Gmail、Notion。
  • permission — 權限。它被允許做什麼,哪些事要先問過你。

照「使用者能控制多少」來看,我會粗略把市面上的產品分成三檔:

  • ChatGPT / Claude 的 chat — 對話入口。四層幾乎都是固定的。
  • ChatGPT Work / Claude Cowork — 任務模式。開放一部分給你設定。
  • codex / Claude Code — 環境模式。開放最多,幾乎全部你自己決定。

這是心智模型,不是官方分類。但接下來一層一層看,你會發現它比官方文案好用,因為它可以直接拿來判斷一個 AI 到底能做到哪裡。

大腦:差距不在這裡

先講大腦,因為這裡藏著最大的誤解。

很多人把「chat 比較笨、codex 比較猛」直接理解成模型差異。但即使底層是同一世代、甚至同一顆模型,最後表現都可能差非常多 — 因為真正拉開體感差距的,是下面三層:它知道多少、碰得到多少、被允許做多少。

所以你真正能自己改裝的,通常不是大腦。是 context、tools、permission。AI 升級的方向不是「換一顆更聰明的腦」,而是把另外三層的空格接手過來自己填。

Context:推、拉、就是

Context 的差異,我用三個動詞記:推、拉、就是。

  • Chat 主要是你「推」給它。 貼文字、上傳檔案、把 project、memory、connector 接進來。現在的 chat 當然有跨 session 的記憶跟 project context 了,但大部分的工作材料,還是由你決定這次要帶什麼進來。
  • Cowork / Work 開始變成它自己「拉」。 你給它一個資料夾、一個 project、一組 app,它在做事的過程中自己判斷需要讀什麼。
  • codex / Claude Code 則是環境「就是」context。 工作目錄、整個 repo、git 歷史、你放在裡面的 instructions — 它一開工,這些全部都在。你不用每次重新把整個專案餵給它,因為它本來就站在你的資料堆裡面。

執行環境:先問 agent 人在哪

這一層是今年變動最大、也最容易搞錯的。

我原本直覺 chat 在雲端、Cowork 在本機、codex 在本機。實際上哪些在本機、哪些在雲,比較像是每個產品內部的一個設定。

  • Chat:基本上在雲端。很多進階功能背後有 sandbox,能跑程式、處理檔案,而且環境被玩爛了都不會影響我們電腦。
  • Cowork / Work:都跨進「雲端執行+本機資源」的混合區,但兩家實作不太一樣。Claude Cowork 明確分 remote / local 兩種執行模式,desktop 設定裡有開關可以自己撥("Run new tasks in the cloud"),預設被選為雲端;ChatGPT Work 則是 web / mobile 走雲端,desktop 版可以開本地資料夾、用 desktop app,還區分 cloud chats 跟 local chats。
  • codex / Claude Code:本機為主,但也都有雲端 task 模式,把任務丟去廠商的容器跑。

這裡分享一個我自己踩過的坑。Cowork 裡資料夾明明在 UI 上顯示連著,agent 卻說它讀不到。查權限、查設定,全部正常。最後我直接問它工作目錄是什麼,它回:

/home/claude

雲端的路徑。不是我的硬碟。

那一刻我才意識到,我的 session 根本不在我電腦上跑。之後遇到任何詭異的存取行為,我的第一個診斷動作都變成:先問 agent 它人在哪。

很多看起來像「權限壞掉」的問題,其實先是「位置問題」— 你以為它在本機,它其實人在雲端。

工具:本體在哪台機器

工具這一層,我只用一個判斷法:這個工具真正的本體,到底在哪台機器上?

用最多人需要的工具當主案例 — 瀏覽器。先把三件常常被混在一起的事拆開:

  • 「讀」網頁。 web search、抓網頁內容。這只是查資料,不是操作瀏覽器。chat 就能做。
  • 操作「一個」瀏覽器。 agent 開一個自己的 browser 去點、去填、去逛。看起來很厲害,但那個瀏覽器裡預設什麼都沒登入。
  • 操作「你的」瀏覽器。 你那個登著 Gmail、登著公司後台、存著所有 cookie 的 Chrome。

差別在哪?在於瀏覽器真正值錢的本體,不是 Chrome 這個程式 — 是你的登入狀態。回信、訂票、進後台改東西,全部住在你的 cookie 跟 session 裡。而那些東西,在你的機器上。

對照現在的產品:chat 做不到直接操作你的瀏覽器,因為它碰不到你本機那個已經登入好的 session。Claude 這邊最典型的是 Claude in Chrome — extension 直接接進你正在用的那個 Chrome。ChatGPT desktop 則是內建一個自己的 browser,可以登入、有自己的狀態,但那跟「直接接管你原本 Chrome 的 session」不是同一件事。到了 codex / Claude Code,Playwright、CDP 這些全套本機方案都能上,控制粒度最細。

檔案類的工具,同一個判斷法再跑一次:

  • Gmail、Notion、Slack — 本體在雲端。connector 或 remote MCP 接得到,哪一檔產品都能用。
  • Obsidian、你自己寫的 script、你的本地資料庫 — 本體在你硬碟上。要完整使用,就需要 agent 能真的碰到你的本機環境。

拿一個實際任務試:「把這週 Gmail 的專案信整理出來,對照 Obsidian 的會議筆記,寫週報進 Notion。」

純雲端的 chat,前後兩段靠 connector 做得到;但如果 Obsidian vault 只存在你的本機、沒有另外暴露出去,中間那段就接不到,你只能手動貼筆記。Cowork 把 vault 授權進去之後,檔案本身可以讀了;但如果你的流程還依賴 Obsidian 社群那些 local MCP、localhost service,就會再卡一次 — 官方自己明寫,local MCP server 不會在 remote session 裡執行。到了 codex / Claude Code,本機環境整個打通,這些才全部串得起來,而且這個週報流程可以留下來,下週再跑一次。

所以接任何工具之前,先問:它的本體在哪?在雲端,大多數產品都接得到。在你電腦裡,就要問第二題:這個 agent 能不能真的碰到我的本機環境?

權限:劃界線,還是開通道

權限這一層,本機跟雲端的玩法幾乎相反。

本機(codex / Claude Code):權限是兩個獨立的旋鈕。一個決定「能」做什麼 — 能寫哪些資料夾、能不能連網。一個決定什麼時候要「問」你 — 每次都問、越界才問、還是都不問。

這兩件事真的不一樣。你可以讓它有能力做某件事,但每次做之前都要問你;也可以把它關在一個很小的範圍裡,但範圍內全部讓它自己來。codex 跟 Claude Code 現在都是這種二維切法,而且兩家預設都不會直接給毫無限制的本機權限 — sandbox 管範圍、approval 管使用節奏,個別控制。

我都是無腦權限全開、想做什麼都不用先問,自己跑到底就對了。

雲端(Cowork / Work):邏輯反過來。session 本身碰不到你電腦的任何東西,權限是用「授權」每次同意慢慢長出 — 每連一個資料夾,它就多一隻手。

一樣是「權限」:在本機是「劃界線」,在雲端是「開通道」。

實作:把 codex 改裝成帶著走的專屬 agent

講到這裡,codex / Claude Code 已經滿足一個 agent 的全部基本要求:四層都有,而且你能控制的部分最多。那就實際復刻一個。用 codex 這邊當例子:

  1. 在桌機的 app 切到 codex,選一個資料夾,開新對話。第一件事是設計人格:在資料夾裡放一個 AGENTS.md,寫清楚它是誰、語氣、禁區、輸出格式、什麼情況要停下來問你。codex 會把它當成常駐的工作指示,每次開工都先讀一次 agent 的設定。
  2. 配對。在 ChatGPT desktop 上的連線 ->「新增裝置,以遠端控制這部 Mac」,再用手機 ChatGPT app 的「遠端」功能配對這台主機。配好之後,手機能看到即時進度、批准操作、丟新任務。而且檔案跟權限全部留在電腦上 — 手機就變遙控器了。
  3. 完成。之後只要新聊天開那個資料夾,它就是你的專屬 agent — 有你給的人格、站在你的資料裡、能上網、能寫檔案回你電腦,而你人在捷運上也管得到它。

第一步填 AI 人格,資料夾本身填 Context 的範圍。第二步「配對」把本地端 AI 操作延伸到手機上,「權限」從頭到尾從你的電腦展開,由你自己決定。

代價:一台不能關的電腦

我們總不會想要 agent 一天到晚斷線 — 手機遙控再方便,主機一睡著,一切就停了。

弄一台低功耗的常開小主機。Mac mini 這種等級的機器很適合當 agent 的家,我自己就是一台 Mac mini 搭配一台 Windows 常開。但是也可以把「不能關的電腦」外包給廠商,也就是切去「雲端」執行。零維運,但代價就是前面講過的 — local process 起不來,某些只存在本機的工具會重新斷掉。

地端還是雲端?本質上是就在思考:AI 能力、權限的分界。

四層思考模型,讓你追工具輕鬆點

以後任何新的 agent 產品出來,四層思考:

  • 它的 agent 本體跑在哪台機器。
  • 程式執行在哪台機器。
  • 它能不能真的使用我本機上的工具 — script、database、localhost service、MCP。
  • 權限是幾個旋鈕,誰在轉。

第三題最關鍵。 因為很多產品看起來都「可以讀本機檔案」,但讀得到「一個」檔案,跟真的能使用你「整套」工具,是兩回事。

如果它只能透過 desktop app 把檔案傳進去,你能用的通常就停在「檔案」這一層;如果 agent 本身真的能在你的機器上執行,它才有機會直接用你原本的 script、database、browser、localhost、整套開發工具。

這就是很多 agent 看起來功能差不多、實際能力邊界卻差很多的原因。

現在我不想留記錄的閒聊、研究過程、一次性任務,我都是無腦用 Chat(遠端 + 不需維護記憶)。專案、系統規劃、人生規劃、複雜操作,無腦選 codex / code(地端 + 自己維護長期記憶)。

work / cowork 反而是我最不會用的,因為他們給的權限跟能力邊界很瑣碎,我覺得好難用。

這四層思考解決「能力邊界」、「權限邊界」、「記憶維護」等所有 agentic 時代最重要的問題。

#ChatGPT#Codex#Claude Code#Agent#AI#MCP