最近有些新聞,叫做 AI 疲勞症。意思是你覺得 AI 會省你的時間,但你反而更疲勞了。另一種說法是,多用 AI 的人,就是屬於不動腦的那種人。
我好像沒有寫過疲勞這件事。
先講時間點。我從 2022 年 GPT-3.5 的時候就開始用了。三年多,不累。累這件事,大概是到 GPT-5 開始,agent 的能力起來之後,才覺得比較累。
所以到底是什麼在累?
不動腦?
今天我把最近所有專案的對話全部接進記憶系統。來源有 Claude Code、Codex、OpenCode、Kimi Code。9/4 到 9/10 六天,40 筆對話還沒撈完,倉庫橫跨 omlx、Voco、Vocotype、VocoReplayLab、edgelink、b-log,還有另外四個。
我的實際感覺是相反的。自從有了這些東西,我的腦動得更多了。
不動腦的話,這些東西不會存在。
累的是哪三個動作
看 diff 是一個。
第二個,每個 agent 的能力都不一樣。你要知道誰適合做什麼。
第三個是身體上的。以前一根手指打字的時候也會累,但那是打字的累。現在只需要按一下 FN 就好。反而是每次要去點鍵盤右上角的 Touch ID 解鎖,那個是最累的。常常因為自動化測試要解鎖鑰匙圈,或只是解鎖螢幕,都要按。
擂台
9/5 我建了一個 model-arena。原因是一個很庸俗的問題:錢。Codex 的額度燒完之後,我不可能再開另外一個 200 美元的方案去支撐額度,要不然薪水全部砸在這上面,算了。所以要知道本地的 Qwen3.8-Flash-Next 跟 GLM-5.3 Flash 到底能接多少東西。
做法是自造一個小專案,埋雷,寫隱藏測試,兩個模型各跑一份,自動判分。第一輪兩個都 14/14,產出逐 byte 相同。第三輪 21/21。第五輪 GLM 從零寫一個持久化工作佇列,22 條黑箱測試,第一次交件全過。
這件事其實挺有趣的。現在本地模型出的頻率越來越快,架構也都不一樣。
那為什麼擂台有趣,「知道誰適合做什麼」卻很累?
擂台是有判分的判斷。每輪跑完就知道對錯。日常分派任務是沒有判分的判斷,你猜它能接,它接了,對不對要等 diff 出來才知道,看 diff 又是另一個沒判分的判斷。
有判分的判斷不累,沒判分的才累。
誰喊停
擂台跑到第五輪,AI 還提議要測第六輪。我直接說不用了。能力的邊界就這樣啊,你測試多了,他的能力也不會變好。
第三輪的時候 Claude 估本地模型會拿 12 到 17 分,結果 21/21。第五輪估 GLM 做不到,做到了。
沒有停止條件的是 AI,估錯的也是 AI。
真正的風險不是不動腦
八月 CorePatch 的 B619 炸掉我兩次開機。第二次為什麼會炸,那篇最後一節寫過了:第一次沒驗證過的結論,被當成事實記了下來。下一個 AI 引用它,直接把 CorePatch 排除。
腦有動。動的方向錯了。
所以我累是正常的嗎?這是我今天問 AI 的問題。
