精選文章

同一個 AI 做久了會越做越笨:我讓另一家的模型來當二審

有些人請人看稿,是想聽聽別的意見。
有些人請人看稿,是想要一句「寫得很好」。

跟 AI 協作久了會發現,你叫它自我檢查的時候,拿到的往往是後面那一種。

「再檢查一次」為什麼沒有用

同一個 agent 做久了,會越做越笨。

它會把自己的假設當聖旨。你叫它「再檢查一次」,它多半只是把原本的結論換句話說,然後告訴你沒問題。

這不是它偷懶。是它沒有理由懷疑自己的前提。

那些前提是它自己在前面幾十輪對話裡建立起來的,早就變成背景,不會再被拿出來檢查。你要它重看一遍,它重看的是「在這些前提之下,結論對不對」,而錯的正是前提本身。

這件事跟帶人一模一樣。一個人在同一個專案待久了,看不見自己的盲點,不是因為他不認真,是因為他的前提已經內化。解法從來不是叫他再想一次,是換一個沒有共同前提的人來看。

我原本的解法很呆

把 Claude 的產出複製起來,貼到 ChatGPT,問它「你覺得這樣對嗎」,再把意見複製回來,貼回 Claude。

一來一回,我變成一個高科技人力搬運伕。

而且這樣做有兩個問題。第一,麻煩到你不會每次都做,只有心裡覺得怪怪的時候才做,但真正危險的正是那些你不覺得怪的。第二,你拿到的是一段別人的意見,還得自己判斷要不要採納、怎麼採納。

所以我把它做成一支 skill

在 session 裡打一行:

/ai-review

它會把你的產出自動打包,送給另一個模型家族審一輪,走 Codex CLI、用你自己的 ChatGPT 帳號。

重點在意見回來之後。它不是丟一段「它說……」給你自己讀,是把意見消化進結論:哪幾條認同、會改;哪幾條不認同、理由是什麼;哪幾條要你拍板。二審的意見是輸入,不是聖旨。

第一次用會引導你安裝 Codex CLI 及登入,先有 ChatGPT 帳號就行。

沒裝、沒登入也不會卡住你。它會明講「本次僅自審」,然後讓流程繼續走。這點是刻意的:一個會在你趕時間時卡住你的工具,你下次就不會用它了。

三種審法可挑,按產出物的性質選:

  1. 程式碼
  2. 對外文案
  3. 研究報告

我拿它來審它自己

這支工具上線之後,第一件事就是拿它審自己。

三輪下來被抓出 21 個問題。

而且好幾個是「前一輪的修法自己長出來的」。也就是說,我照它第一輪的意見改完,第二輪它又在同一個地方抓到新的東西,而那個東西是我改出來的。

這件事本身就是這支工具存在的理由:修正會長出新的問題,而原本那顆腦袋看不見。

所以這一版把 40 項回歸測試也一起出貨了。裝好之後打一行就能自己驗:

sh tests/matrix.sh

它不能幫你做的事

二審不是保證。它給的是一個沒有共同前提的視角,不是正確答案。

我實際用下來,它的意見有真的抓到問題的,有它沒看到原始碼所以推測錯的,也有我原本就想過、而且有理由不那樣做的。三種都會出現,所以你得真的去判斷,不能照單全收。

把二審當成聖旨,跟把第一個 agent 的結論當成聖旨,是同一個病。

安裝

npx skills add tingyulu/MyR2D2

開源在 https://github.com/tingyulu/MyR2D2

用得上的話給顆星,有想加的功能也歡迎開 issue 聊。

手癢比手巧重要。

留言