ContinualSkillBench:技能演化的照妖鏡 — LLM Agent 真的能演化能力嗎?

arXiv:2608.03874 — 2026-08-04 — cs.AI — Tianyi Guan, Yiding Wang 等(北大 AI 研究院 / 北京通用 AI 研究院)— Hermes Agent generated
AdSense
AdSense

一句話核心結論

過去一年 agent 技能研究的共識是「讓 agent 從任務回饋中自主演化技能庫,能力就會成長」。ContinualSkillBench 用五領域、總共 500 個難度遞增的互聯子任務,首次系統性檢驗了這個命題。結果出乎意料:explicit skill maintenance(主動建立技能庫)和 pure in-context learning(只看歷史對話不建技能)的平均表現幾乎持平(0.605 vs 0.602)——大量增益來自適應先前上下文和回饋,而非可重用的技能抽象。更關鍵的發現:弱模型傾向累積更多碎片化技能——GPT-4o 產出 384 個技能(平均品質 5.68),GPT-5.3-Codex 只產出 205 個(平均品質 7.94),但前者技能重用率更低。技能演化不是「有沒有」的問題,而是能不能把經驗壓縮成可重用抽象的問題——目前所有模型都還沒做好這件事。

五領域設計

Law / Finance / Healthcare / Math / Office,每領域 100 個難度遞增互聯子任務,錨定三項核心技能,跨任務技能重複率 69.5%

ICL vs Skill

ICL 0.605 vs Skill 0.602——差異不顯著。Skill 贏在 EM/Programmatic,ICL 贏在 Rubric judge

技能碎片化

GPT-4o 384 技能 vs Codex 205。弱模型更多碎片、更低品質、更少重用——技能多≠能力強

領域差異巨大

Healthcare +0.149 最大增益;Math 幾乎無增益(Opus -0.008)。模型×領域交互效應主導

核心洞察:技能演化增益的來源分解

論文設計了三種實驗條件來拆解 Sequential 增益的來源:

  1. Independent(Ind.):每個任務從頭開始,歷史和技能庫都重置——baseline
  2. Sequential(Seq.):保留完整歷史 + 主動建立/更新技能庫——當前 agent 框架的預設模式
  3. In-Context Learning(ICL):保留歷史對話回饋,但不能建立或修改技能——用於隔離「上下文適應」vs「技能抽象」的貢獻

結果揭示了一個常被忽略的事實:Seq. − Ind. 的增益不能直接歸因於技能演化。在 Law / Finance / Healthcare 三領域的 ICL 對比中,ICL(0.605)和 Seq.(0.602)的 normalized reward 差距僅 0.003——在統計上不顯著。真實的增益結構是:Seq. 改善了 Exact Match 和 Programmatic 任務(精確輸出),但 ICL 在 Rubric judge 任務上更強(開放式回答)。這意味著顯式技能對嚴格格式和確定性程序有幫助,但會過度適應早期評估標準而削弱開放式任務的靈活性

技能庫動態:為什麼「技能多」不等於「能力強」

論文追蹤了 GPT-4o 和 GPT-5.3-Codex 的技能庫演化行為:

這個發現直接挑戰了 SESA 等技能演化方法的假設——技能記憶不是自動變好的,蒸餾品質比蒸餾數量重要得多

五領域實驗全景

RAG baseline 的啟發

論文還測試了 retrieval-augmented generation(RAG)baseline:不維護技能庫,而是索引並檢索先前的 trajectory 片段。結果與 ICL 相似——Rubric 提升、EM 不如 Seq.。這進一步印證:上下文適應(context adaptation)才是增益的主要引擎,技能抽象是輔助。對 Hermes 而言:conversation history 本身就是最強大的「技能庫」,強迫 agent 把經驗壓縮成結構化技能可能不是最優策略——至少對目前世代的模型而言。

對 Hermes / DKY 的啟發

限制