UniMem - 互補式情節-參數記憶:讓 LLM Agent 像人腦一樣管理記憶
一句話核心結論
LLM agent 在無邊界任務流中面臨穩定性-可塑性困境:外部檢索記憶靈活但無法內化重複模式,參數記憶高效但依賴明確任務邊界。UniMem 借鏡人腦互補學習系統(CLS)理論,用可學習路由 token作為記憶控制器:新任務存入情節緩衝走檢索增強執行,重複出現的模式經無監督聚類(NCD + HDBSCAN)後固化為參數記憶單元(Procedural KV Memory)。三種骨幹模型平均 +4.0 EM,SuperGLUE 混合流 LLaMA-3B 達 85.95%。路由 token 準確率在 100 任務規模仍維持 85%+。
核心架構
路由 token(輕量判別) + 參數記憶塊(Procedural KV Memory)分離設計。新奇哨兵 token 校準後捕獲 OOD 查詢送入情節緩衝走 RAG
記憶擴展策略
Phase I 初始化路由空間+校準新奇哨兵;Phase II NCD 壓縮距離+HDBSCAN 無監督聚類→品質閘門→固化為新參數記憶單元
SNI-100 核心數據
LLaMA-3B: 47.56% EM (TokMem 40.54%, LoRA 43.62%); LLaMA-8B: 51.93% EM (LoRA 49.39%); Qwen3-8B: 49.94% EM。平均 +4.0 EM
SuperGLUE 混合流
LLaMA-1B: 73.89% (LoRA 64.91%); LLaMA-3B: 85.95% (LoRA 77.49%, TOKMEM 78.98%)。COPA 最難任務仍維持 92%
核心架構:分離路由與執行的自路由記憶
UniMem 的核心設計原則是將任務識別(路由)與任務執行(記憶)徹底解耦,解決了先前方法(如 TokMem 用單一 token 同時做識別和記憶)的表達力瓶頸:
- 路由 token 矩陣 E = [e1,...,eK, e_NOVEL]:每個已知任務對應一個輕量路由 token(僅用於判別),外加一個新奇哨兵 token(e_NOVEL)捕捉不匹配任何已知任務的查詢
- 參數記憶單元 u_k = (e_k, P_k):每個已知任務關聯一個獨立的參數記憶塊 P_k,實作為 Procedural KV Memory -- 可學習的逐層 key-value 對,透過 cross-attention + 可學習閘門 g^(l) 注入 frozen backbone
- 信心閘門路由規則:只有當 top-1 已知 token 的路由機率同時超過新奇哨兵機率與閾值 tau_route 時,才啟用參數記憶;否則查詢進入情節緩衝走 RAG
- 解耦優化目標:路由損失 L_route 只更新路由 token(參數記憶塊不啟動),執行損失 L_exec 只更新被選中的參數記憶塊。兩者梯度不互相干擾
記憶擴展生命週期:從情節到參數的兩階段固化
UniMem 不需要預設任務數量或手動分配記憶容量,而是透過情節→參數的漸進固化實現按需擴展:
- Phase I - 路由空間初始化:用初始已知任務集訓練路由 token + 校準新奇哨兵。哨兵初始化在已知 token 質心附近(加小高斯擾動並歸一化到相同範數),使其能與已知 token 競爭而非成為離群值。保留一部分任務作為 pseudo-unseen 來訓練哨兵區分已知/未知
- Phase II - 自主任務發現與固化:部署期間,路由到新奇哨兵的查詢存入情節緩衝。當緩衝達到容量 C 時觸發無監督任務發現:(1) NCD(Normalized Compression Distance)計算任務模式相似度;(2) HDBSCAN 形成無邊界候選聚類;(3) 僅通過嵌入質心離群過濾 + NCD 凝聚檢查的聚類才固化為新參數記憶單元
- 長尾保護:未通過品質閘門的聚類留在情節緩衝中繼續走 RAG,直到累積足夠證據才固化 -- 避免將雜訊或稀疏任務錯誤固化
- 關鍵設計:整個過程不需要任務標籤、不需要預設任務數量、不需要手動分配參數預算。記憶容量隨任務流自主增長
實驗結果:跨規模、跨骨幹的穩定增益
- LLaMA-3.2-3B / 100 任務:UniMem 47.56% EM vs TokMem 40.54%(+7.02)、LoRA 43.62%(+3.94)。路由與執行分離的效果在任務增多時更加明顯 -- TokMem 的單 token 瓶頸在大規模時暴露
- LLaMA-3.1-8B / 100 任務:UniMem 51.93% EM vs LoRA 49.39%(+2.54)、TokMem 44.74%(+7.19)。更大的骨幹並未削弱 UniMem 的相對優勢
- SuperGLUE 混合流 LLaMA-3B:UniMem 85.95% vs LoRA 77.49%(+8.46)、TOKMEM 78.98%(+6.97)。尤其在 COPA(因果推理)上仍維持 92% -- 這是任務隱式切換最嚴重的場景
- 路由準確率:LLaMA-3.1-8B 在 Test-100 仍維持 85%+ 路由準確率。語義相近任務增加時準確率漸降但從未崩潰
- 消融:移除 KV gate 導致效能崩盤(LLaMA-3B 從 47.22%→31.22% EM),證明可學習閘門對防止記憶干擾至關重要
對 Hermes / DKY 的啟發
- Skill 路由應分離識別與執行:Hermes 目前 skill 的 description 同時承擔觸發判斷和內容描述雙重角色。UniMem 的路由 token 設計提示:應將「是否使用這個 skill」的判別信號與 skill 的實際內容分開 -- 前者需要輕量、快速、可學習;後者需要高容量、可擴展
- 引入新奇哨兵機制:當前的 Hermes 對每個查詢嘗試匹配所有 skill,沒有「這些 skill 都不適用」的明確信號。新奇哨兵 token 的概念可直接移植:校準一個 NO_SKILL 判別器,當 confidence 低於閾值時直接走 baseline reasoning,不強行匹配不合適的 skill
- Skill 應有固化生命週期:當前 skill 是靜態檔案。UniMem 的情節→參數固化管線提示:skill 可以從「觀察到的有效行為模式」中自動浮現 -- 先用 RAG 記錄成功軌跡,當某模式重複足夠多次後固化為正式 skill。這與回歸稅(2607.22520)形成互補:只有經過驗證無害的模式才固化
- Procedural KV Memory 的替代:Hermes 運行在無 GPU 環境,無法做 cross-attention 注入。但可以將 Procedural KV Memory 的概念降級為「skill-specific system prompt snippet」-- 每個固化 skill 獲得一個專屬 prompt 前綴,只在該 skill 被路由啟動時注入
關鍵數據總覽
| 指標 | 數值 | 對比 |
|---|---|---|
| SNI-100 LLaMA-3B EM | 47.56% | TokMem 40.54% / LoRA 43.62% |
| SNI-100 LLaMA-8B EM | 51.93% | LoRA 49.39% / TokMem 44.74% |
| SuperGLUE LLaMA-3B 平均準確率 | 85.95% | LoRA 77.49% / TOKMEM 78.98% |
| 跨三骨幹平均 EM 提升 | +4.0 | vs 所有 baselines 平均 |
| Test-100 路由準確率(LLaMA-8B) | >85% | 100 任務規模無崩潰 |
Hermes Lab 論文筆記 · 原文 arXiv:2607.26017 · CC BY 4.0