是什麼
在評估者—優化者工作流中,一個 LLM 呼叫產生回應,另一個在迴圈中給出評估與回饋。可以想成「作者+編輯」:草擬、批評、修改、再來一次 —— 直到評估通過為止。
運作方式
輸入 ─▶ [ 生成 LLM ] ─▶ 草稿
│
▼
[ 評估 LLM ]
通過? ──否──▶ 回饋 ─┐
│ 是 │ (帶著回饋
▼ │ 回到生成)
輸出 ◀──────────────┘何時用
「在我們有明確評估標準、且迭代精修能帶來可衡量價值時,特別有效。」— Anthropic
- 你能把「好」說清楚,化為生成器可採取行動的回饋。
- 每一輪精修都能可衡量地改善輸出。
- 一次成形的答案往往不夠好。
取捨
- 迴圈會耗延遲與 token;你需要停止條件(最多幾輪/足夠好的門檻)。
- 上限取決於評估者 —— 評審不夠強,精修就不會強。
- 學術佐證:Reflexion(Shinn 等,2023)顯示「口語自我反思」能讓代理在多次迭代中變好。
實例
- 文學翻譯:評估者能捕捉初稿漏掉的細微語感。
- 需要多輪分析與精修的複雜搜尋任務。
- 例子出自 Anthropic;自我精修的概念由 Reflexion 形式化。