最近有些新聞,叫做 AI 疲勞症。意思是你覺得 AI 會省你的時間,但你反而更疲勞了。另一種說法是,多用 AI 的人,就是屬於不動腦的那種人。

我好像沒有寫過疲勞這件事。

先講時間點。我從 2022 年 GPT-3.5 的時候就開始用了。三年多,不累。累這件事,大概是到 GPT-5 開始,agent 的能力起來之後,才覺得比較累。

所以到底是什麼在累?

不動腦?

今天我把最近所有專案的對話全部接進記憶系統。來源有 Claude Code、Codex、OpenCode、Kimi Code。9/4 到 9/10 六天,40 筆對話還沒撈完,倉庫橫跨 omlx、Voco、Vocotype、VocoReplayLab、edgelink、b-log,還有另外四個。

我的實際感覺是相反的。自從有了這些東西,我的腦動得更多了。

不動腦的話,這些東西不會存在。

累的是哪三個動作

看 diff 是一個。

第二個,每個 agent 的能力都不一樣。你要知道誰適合做什麼。

第三個是身體上的。以前一根手指打字的時候也會累,但那是打字的累。現在只需要按一下 FN 就好。反而是每次要去點鍵盤右上角的 Touch ID 解鎖,那個是最累的。常常因為自動化測試要解鎖鑰匙圈,或只是解鎖螢幕,都要按。

擂台

9/5 我建了一個 model-arena。原因是一個很庸俗的問題:錢。Codex 的額度燒完之後,我不可能再開另外一個 200 美元的方案去支撐額度,要不然薪水全部砸在這上面,算了。所以要知道本地的 Qwen3.8-Flash-Next 跟 GLM-5.3 Flash 到底能接多少東西。

做法是自造一個小專案,埋雷,寫隱藏測試,兩個模型各跑一份,自動判分。第一輪兩個都 14/14,產出逐 byte 相同。第三輪 21/21。第五輪 GLM 從零寫一個持久化工作佇列,22 條黑箱測試,第一次交件全過。

這件事其實挺有趣的。現在本地模型出的頻率越來越快,架構也都不一樣。

那為什麼擂台有趣,「知道誰適合做什麼」卻很累?

擂台是有判分的判斷。每輪跑完就知道對錯。日常分派任務是沒有判分的判斷,你猜它能接,它接了,對不對要等 diff 出來才知道,看 diff 又是另一個沒判分的判斷。

有判分的判斷不累,沒判分的才累。

誰喊停

擂台跑到第五輪,AI 還提議要測第六輪。我直接說不用了。能力的邊界就這樣啊,你測試多了,他的能力也不會變好。

第三輪的時候 Claude 估本地模型會拿 12 到 17 分,結果 21/21。第五輪估 GLM 做不到,做到了。

沒有停止條件的是 AI,估錯的也是 AI。

真正的風險不是不動腦

八月 CorePatch 的 B619 炸掉我兩次開機。第二次為什麼會炸,那篇最後一節寫過了:第一次沒驗證過的結論,被當成事實記了下來。下一個 AI 引用它,直接把 CorePatch 排除。

腦有動。動的方向錯了。

所以我累是正常的嗎?這是我今天問 AI 的問題。