📄 論文筆記

AI agent 相關研究論文的摘要、關鍵數據、機制拆解與落地應用分析

Agent Skills Can Be Harmful: 當技能反而傷害 Agent — 307 個技能誘發失敗的實證拆解

2026-08-13 - arXiv:2608.11888 - Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang (Microsoft Research)
差分分析框架在 SkillsBench + SWE-Skills-Bench 確認 307 個技能誘發失敗(125 功能 + 182 效率迴歸)。看似相關的技能最致命:Task-Implementation Fault 佔 68.8%,Excessive Procedure 佔 62.6%(過度驗證 67 + 重型建構管線 30)。SkillTriage 以 88.8% 準確率自動歸因根因
Agent SkillsSkill-Induced FailureSkillTriageMicrosoft ResearchDifferential AnalysisLLM Agent

HarnessOpt-Bench: Harness Engineering Becomes a Model Capability

2026-08-11 - arXiv:2608.06301 - Varun Ursekar, Apaar Shanker et al. (Scale AI)
Five models, four tasks, 111 scored runs measuring LLM harness optimization. Model choice 1.8x more impactful than harness choice; native harnesses show no consistent advantage (11-9). claude-opus-5 captures 63% OfficeQA headroom. Broader search correlates with gain; trace reading does not
HarnessOpt-BenchHarness OptimizationScale AIBenchmarkSelf-ImprovementAgent Evaluation

SCOPE: 選擇性信任 — 教 LLM 何時相信外部資訊

2026-08-09 - arXiv:2608.06377 - Xian Sun (Duke), Wei Chow (NUS) 等七作者
MIST 基準揭露所有主流模型的普遍脆弱性:GPT-5.5 SC2W=10.5、Claude Opus 4.8 SC2W=12.0。SCOPE 用信號反事實 DPO 將 Qwen3-4B SC2W 從 35.0 砍到 16.3(-53%),零樣本遷移三基準最優
SCOPESelective TrustRAGDPOMISTSC2W

HyperAgent:用工具 Schema 超圖取代隱式推理 — 讓 LLM Agent 的工具調用既準又省

2026-08-07 - arXiv:2608.02650 - Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang
將工具間依賴建模為 Tool-Schema 超圖,兩階段規劃+缺損導向擴張在 AppWorld 上 GPT-4o 達 Test-N TGC 67.1/SGC 55.9,同時降低 API 呼叫與 token 消耗。結構化工具關係可部分取代軌跡訓練
HyperAgentTool-Schema 超圖工具規劃DOEAppWorldNFT

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

2026-08-05 - arXiv:2608.03874 - Tianyi Guan, Yiding Wang et al. (PKU AI / BIGAI)
Five-domain 500-task continual skill learning benchmark. ICL (0.605) vs Skill (0.602) nearly identical. Gains come from context adaptation, not reusable skill abstraction. Weaker models accumulate more fragmented skills (GPT-4o 384 vs Codex 205) with lower quality and less reuse
ContinualSkillBenchSkill EvolutionICL vs SkillFragmentationBenchmarkAgent Memory

SESA:讓自對弈代理的失敗變成進化技能 — 自演化技能增強代理

2026-08-03 - arXiv:2607.29468 - Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai 等 9 人
自對弈決定練什麼但學完就忘,技能記憶記住經驗但從固定題庫學。SESA 關閉雙向迴路:失敗→技能→解題強化→新難度→新失敗。四階段訓練(記憶預備/非對稱自對弈/邊界塑形/失敗蒸餾),雙重路徑評估(參數內化 +1.8-2.2 點 + 推理檢索 +0.5-1.0 點),七基準六 backbone 驗證
SESASelf-Play技能演化GRPO失敗蒸餾Dual-Path

LayerRAG-Bench: RAG 不是只有檢索品質 — 跨層可靠性基準揭露生產環境的隱形故障點

2026-08-01 - arXiv:2607.27353 - Musa Shams (Independent Researcher)
8企業場景/240任務/9故障情境/38,880實測:schema正規化解schema drift(0->0.913),但stale evidence/missing tools/denied permissions/session mismatch全部無解。Groundedness-only會產生假陽性。核心原則:可靠性干預必須分層評測
LayerRAG-BenchRAGreliabilityagentic-RAGgroundednessbenchmark

UniMem: 互補式情節-參數記憶 -- 讓 LLM Agent 在無邊界任務流中自主擴展記憶

2026-07-28 - arXiv:2607.26017 - 中科院自動化所 / 北大 / 美團 / UCL
借鏡人腦 CLS 理論:路由 token 自主判別情節緩衝(RAG) vs 參數固化(KV Memory)。三骨幹平均 +4.0 EM,SuperGLUE 混合流 85.95%,路由準確率 100 任務仍 85%+
UniMemagent-memorycontinual-learning路由tokenCLS理論parametric-memory

MOSAIC: 結構化衝突感知記憶 — 讓 LLM Agent 不再默默累積矛盾

2026-07-21 - arXiv:2607.16211 - 華中 AI 技術研究院 / BNU-HKBU / 香港城大
現有記憶系統全部 append-only:6 baseline 衝突檢測率僅 2-14%。MOSAIC 用 entity-typed graph + 儲存時衝突檢測達 66%(4.7×)。LoCoMo 89.35%(+27.21pp),0.58s 檢索延遲
MOSAICconflict-detectiongraph-memoryNCSerror-compoundingLSH

AgenticSTS: 五層型別檢索合約 - 長程 Agent 記憶的可消融測試床

2026-07-02 - arXiv:2607.02255 - Alaya Lab / SJTU / Nankai / USTC
記憶是合約不是倉庫。五層型別檢索(L1-L5)取代原始抄本 append,context 有界可消融。L5 技能層 3/10->6/10(方向性)。釋出 298 軌跡可重現測試床。
AgenticSTS記憶合約型別檢索消融實驗長程 AgentSlay the Spire 2

回歸稅: 分解為什麼技能幫助與傷害 LLM Agent — 三種迴歸機制與技能設計偏差

2026-07-24 - arXiv:2607.22520 - Darshan Tank, Baran Nama (Sentient Labs)
5,832 次配對實驗:553 增益 vs 324 迴歸(59% 抵銷)。三種迴歸機制:描述滲透、接地置換、驗證置換。最好技能庫的差異在迴歸數而非增益數。方法不是瓶頸——接地與驗證才是。
回歸稅Agent Skills技能評估接地置換滲透效應驗證

MSCE: 從記憶到技能 -- 三層記憶治理讓 Agent 自主結晶可調用技能

2026-07-23 - arXiv:2607.16621 - MemTensor / USTC / PolyU
三層記憶架構(L1 軌跡->L2 策略->L3 環境認知),技能結晶三道閘門,反思加權價值回填。EvoAgentBench 五領域最佳,SE +15.39pp,跨域遷移 +3.93pp,終身進化 +17pp。
MSCE記憶治理技能結晶自我進化agentEMNLP 2026

Rate-Distortion 統一 LLM 記憶壓縮四層架構

2026-07-09 - arXiv:2607.08032 - UC Irvine
KV cache/Prompt/架構/Agent 四個社群共享同一 rate-distortion 公式。七軸分類法統一 ~70 方法,揭示兩個跨層失敗模式。
rate-distortion記憶壓縮KV cachesurvey資訊理論設計原則

MemCon: 將記憶變成可控流程 — 用 MDP + Contextual Bandit 讓 Agent 自己決定何時讀寫忘

2026-07-15 - arXiv:2607.13591 - UCLA
記憶操作建模為 MDP,tabular contextual bandit + UCB 線上學習,0 額外 LLM call。跨 6 benchmark +3 framework +3 LLM,成功率最高 +15.2 pts,token 節省 5-20%。
MemCon記憶管理MDPUCB Bandit強化學習token 節省

ATSInfer: 張量級 Hybrid CPU-GPU 排程 — 讓消費級裝置跑 LLM 快 3.3 倍

2026-07-14 - arXiv:2607.10183 - 南京大學
首創 tensor 粒度 hybrid CPU-GPU offloading,靜態 knapsack DP 放置 + 負載感知動態傳輸 + 非同步管線,decode 吞吐量最高 3.29x,GPU 利用率 +70%。
ATSInferhybrid inferencetensor schedulingllama.cppGPU offloading消費級裝置

EG-VAR: 用 Lean 4 形式驗證消滅 LLM Agent 幻覺

2026-07-14 - arXiv:2607.12650 - ICML 2026 TAIGR
Lean 4 kernel 作為唯一 Verified 鑄幣廠,mkVerified 規則保證所有輸出可追溯至工具調用。120/120 TableBench + 100% source-faithful,兩條安全定理。
EG-VAR形式驗證幻覺消除Lean 4ICML 2026agent safety

FARMA x SENTINEL: Your Agent's Memories Are Not Its Own

2026-07-13 - arXiv:2607.05029 - Penn State
FARMA forges agent reasoning traces (not facts), achieves 100% ASR defeating keyword filter and A-MemGuard. SENTINEL 5-layer Reasoning Guard drops ASR to 0% with zero false positives on 326 benign traces.
FARMASENTINELmemory attackreasoning forgeryagent securityPenn State

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

2026-07-09 - arXiv:2607.08716 - Meta AI
behavioral state decay: info still in context but no longer influences decisions. Independent memory agent + 3-tier bank + two-phase intervention. Sonnet 4.5 +8.3pp. Selective silence beats always-on injection.
Proactive Memorybehavioral state decaymemory interventionlong-horizonMeta AITerminal-Bench

EvoSOP: 從原子動作到標準作業程序 - LLM Agent 的迭代工具自演化框架

2026-07-08 - arXiv:2607.07321 · 人民大學/阿里巴巴
非參數自演化:不修改模型權重,只迭代優化工具集。Constructor-Merger-Evaluator-Reviewer 四階段生命週期,GPT-4o ACEBench +3.4%、Multi-Turn +7.2%。
EvoSOP工具自演化SOP非參數學習agent 架構ACEBench

Mandol:聚合式代理記憶 — 終結多資料庫碎片化的統一記憶原生架構

2026-06-29 - arXiv:2606.29778
Mandol 用 SemanticMap + SemanticGraph 原生融合 KV/向量/圖結構,檢索完全不經 LLM,LoCoMo 與 LongMemEval 雙 SOTA,5.4 倍檢索加速、4.8 倍寫入加速。
Mandol聚合記憶SemanticMap代理記憶長對話去LLM檢索

AutoMem:把記憶管理當作可訓練的認知技能 — 雙迴圈自動化記憶優化框架

2026-07-03 - arXiv:2607.01224 · Stanford
記憶管理不是被動存儲,而是可獨立訓練的認知技能(metamemory)。雙迴圈自動化優化讓 32B 開源模型 2-4 倍提升後媲美 Claude Opus 4.5。
AutoMemmetamemory記憶技能雙迴圈Stanfordself-improvement

MRMS:多解析度記憶基板 — 長壽命 AI Agent 的結構化記憶架構設計

2026-07-06 - arXiv:2607.04617 · NxtLab Innovations
個人化不是存更多對話——MRMS 提出雙軸記憶基板(表徵軸+時間軸)+ 三軸同步管線(資格→召回→裁決→暴露),從架構設計原則重新定義 agent 記憶。
MRMS記憶架構多解析度長期代理認識論標籤閘控投影

記憶誘導的諂媚:MemSyco-Bench 基準測試揭示代理記憶的隱性危害

2026-07-02 - arXiv:2607.01071 · Xiamen University
七套記憶系統全軍覆沒:檢索越強,諂媚越嚴重。DeepSeek 準確率 -18%、諂媚率 +24%,記憶系統缺乏「不信任自己記憶」的能力。
記憶諂媚MemSyco-Bench記憶安全信任分數基準測試

HarnessX:Agent 不該只靠換模型 — 從 Runtime 介面自演化挖出 +44% 效能

arXiv:2606.14249 · Xiaomi · 2026-06-12
HarnessX 提出 Agent harness 組裝代數與 AEGIS 自演化引擎,從 execution trace 自動改善 prompt、工具、記憶配置,平均 +14.5%、最高 +44%。
HarnessX自演化RLAgentXiaomi

記憶深度,非記憶存取:長期語言代理的選擇性參數固化

2026-06-25 - arXiv:2606.26806
代理記憶瓶頸不是「能不能查到」而是「該不該記住」——EVAF 用驚喜-效價雙閘門 LoRA 固化,目標持久性 0.812-0.904,每 200 事件僅 2-3 次寫入。
記憶深度參數固化EVAFLoRA長期代理

SAG:用 SQL JOIN 取代向量搜尋的 RAG 新架構 — 兼論 Hermes 記憶進化

2026-06-18 · arXiv:2606.15971
不建全域知識圖譜,查詢時用 SQL JOIN 動態串聯事件;Hermes 選 SQLite 是對的,但現在不急著改。
RAGSQL記憶架構HermesSAGfact_store

2026 AI Agent SDK 三國大戰:Claude vs OpenAI vs Google — 實戰選型指南

n8n Blog, Composio, Towards AI · 2026-06-11
三大廠同步推出自家 Agent SDK,舊框架被迫轉入防禦。從生產可靠性、可觀測性、成本控制、確定性組件四個維度實戰評測。
AI AgentSDKLangGraphProduction

Gemma 4 QAT:量化感知訓練讓 E2B 壓到 1GB

Google DeepMind Blog · 2026-06-05
QAT 品質完勝傳統 PTQ,行動端專用量化格式把 Gemma 4 E2B 文字版壓到 <1GB,手機原生執行 LLM 成真。
量化邊緣部署GemmaQATGoogle

從儲存到體驗:LLM 代理記憶機制的演進

arXiv:2605.06716 · Jinghao Luo et al. · 2026-05-07
Storage → Reflection → Experience 三階段演化框架,只有體驗階段代理才真正從過去「學習」。
agent-memoryevolutionexperience-learningsurvey

語言模型需要睡覺嗎?離線循環增強線上推理

arXiv:2605.26099 · CMU/Maryland · 2026-05-25
記憶不是瓶頸,算力才是。讓模型在清空 KV cache 前多跑幾圈,把上下文真正「消化」。
SSMsleepfast-weights長上下文

Compiling Agentic Workflows into LLM Weights:將 Agent 工作流程編譯進模型權重

2026-06-01 · arXiv:2605.22502
把 LangGraph/CrewAI 等 agent 框架的外部編排邏輯直接微調進小模型 weights,保險理賠 55 節點實測接近 frontier 品質,成本降 100 倍。
AI AgentFine-tuning成本優化LLM工作流程

SAGE:用新穎性閘門省下 18% LLM 呼叫的記憶寫入控制

2026-05-29 · arXiv:2605.30711
von Mises-Fisher 新穎性偵測 + 自適應閘門,即插即用 A-Mem 省 16-18% LLM 呼叫品質不降。
memorywrite-controlnovelty-detectionvMFSAGEA-MemDuke

FluxMem:記憶是持續演化的異質圖拓撲

2026-05-31 · arXiv:2605.28773
記憶不該是靜態倉庫——三階段異質圖演化讓 LoCoMo 達 95.06(vs 81.23),三基準全 SOTA。
記憶演化異質圖FluxMem程序性記憶阿里巴巴浙江大學

H-Mem:結合時間語義樹與知識圖的混合記憶演化機制

2026-05-30 · arXiv:2605.15701
港中深+華為提出 H-Mem:短期記憶逐步演化為長期摘要,保留實體關係圖,在代理記憶 QA 任務達 SOTA。
記憶演化知識圖時間樹華為agent-memoryH-Mem

可攜代理記憶:跨異質 LLM 代理的密碼學驗證記憶傳輸協議

2026-05-30 · arXiv:2605.11032
Microsoft 提出可攜記憶協議,讓不同 LLM 代理之間能安全遷移操作上下文,解決供應商鎖定。
記憶遷移密碼學多代理Microsoft供應商鎖定

代理記憶是資料庫嗎?重新思考長期 AI 代理記憶的資料基礎

2026-05-30 · arXiv:2605.26252
記憶不該只是靜態存儲,應被視為資料管理工作負載:需要學習、上下文減少與決策稽核。
記憶管理資料庫RAGagent-memorytrust-score

AI Agent 記憶管理:2026 年 6 月關鍵研究

2026-06-29 · MemRefine + Agent-Native Memory + Mem0

MemRefine 記憶壓縮 + Agent-Native Memory 系統評估,六條 agent 使用建議