📄 論文筆記
AI agent 相關研究論文的摘要、關鍵數據、機制拆解與落地應用分析
2026-08-13 - arXiv:2608.11888 - Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang (Microsoft Research)
差分分析框架在 SkillsBench + SWE-Skills-Bench 確認 307 個技能誘發失敗(125 功能 + 182 效率迴歸)。看似相關的技能最致命:Task-Implementation Fault 佔 68.8%,Excessive Procedure 佔 62.6%(過度驗證 67 + 重型建構管線 30)。SkillTriage 以 88.8% 準確率自動歸因根因
Agent SkillsSkill-Induced FailureSkillTriageMicrosoft ResearchDifferential AnalysisLLM Agent
2026-08-11 - arXiv:2608.06301 - Varun Ursekar, Apaar Shanker et al. (Scale AI)
Five models, four tasks, 111 scored runs measuring LLM harness optimization. Model choice 1.8x more impactful than harness choice; native harnesses show no consistent advantage (11-9). claude-opus-5 captures 63% OfficeQA headroom. Broader search correlates with gain; trace reading does not
HarnessOpt-BenchHarness OptimizationScale AIBenchmarkSelf-ImprovementAgent Evaluation
2026-08-09 - arXiv:2608.06377 - Xian Sun (Duke), Wei Chow (NUS) 等七作者
MIST 基準揭露所有主流模型的普遍脆弱性:GPT-5.5 SC2W=10.5、Claude Opus 4.8 SC2W=12.0。SCOPE 用信號反事實 DPO 將 Qwen3-4B SC2W 從 35.0 砍到 16.3(-53%),零樣本遷移三基準最優
SCOPESelective TrustRAGDPOMISTSC2W
2026-08-07 - arXiv:2608.02650 - Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang
將工具間依賴建模為 Tool-Schema 超圖,兩階段規劃+缺損導向擴張在 AppWorld 上 GPT-4o 達 Test-N TGC 67.1/SGC 55.9,同時降低 API 呼叫與 token 消耗。結構化工具關係可部分取代軌跡訓練
HyperAgentTool-Schema 超圖工具規劃DOEAppWorldNFT
2026-08-05 - arXiv:2608.03874 - Tianyi Guan, Yiding Wang et al. (PKU AI / BIGAI)
Five-domain 500-task continual skill learning benchmark. ICL (0.605) vs Skill (0.602) nearly identical. Gains come from context adaptation, not reusable skill abstraction. Weaker models accumulate more fragmented skills (GPT-4o 384 vs Codex 205) with lower quality and less reuse
ContinualSkillBenchSkill EvolutionICL vs SkillFragmentationBenchmarkAgent Memory
2026-08-03 - arXiv:2607.29468 - Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai 等 9 人
自對弈決定練什麼但學完就忘,技能記憶記住經驗但從固定題庫學。SESA 關閉雙向迴路:失敗→技能→解題強化→新難度→新失敗。四階段訓練(記憶預備/非對稱自對弈/邊界塑形/失敗蒸餾),雙重路徑評估(參數內化 +1.8-2.2 點 + 推理檢索 +0.5-1.0 點),七基準六 backbone 驗證
SESASelf-Play技能演化GRPO失敗蒸餾Dual-Path
2026-08-01 - arXiv:2607.27353 - Musa Shams (Independent Researcher)
8企業場景/240任務/9故障情境/38,880實測:schema正規化解schema drift(0->0.913),但stale evidence/missing tools/denied permissions/session mismatch全部無解。Groundedness-only會產生假陽性。核心原則:可靠性干預必須分層評測
LayerRAG-BenchRAGreliabilityagentic-RAGgroundednessbenchmark
2026-07-28 - arXiv:2607.26017 - 中科院自動化所 / 北大 / 美團 / UCL
借鏡人腦 CLS 理論:路由 token 自主判別情節緩衝(RAG) vs 參數固化(KV Memory)。三骨幹平均 +4.0 EM,SuperGLUE 混合流 85.95%,路由準確率 100 任務仍 85%+
UniMemagent-memorycontinual-learning路由tokenCLS理論parametric-memory
2026-07-21 - arXiv:2607.16211 - 華中 AI 技術研究院 / BNU-HKBU / 香港城大
現有記憶系統全部 append-only:6 baseline 衝突檢測率僅 2-14%。MOSAIC 用 entity-typed graph + 儲存時衝突檢測達 66%(4.7×)。LoCoMo 89.35%(+27.21pp),0.58s 檢索延遲
MOSAICconflict-detectiongraph-memoryNCSerror-compoundingLSH
2026-07-02 - arXiv:2607.02255 - Alaya Lab / SJTU / Nankai / USTC
記憶是合約不是倉庫。五層型別檢索(L1-L5)取代原始抄本 append,context 有界可消融。L5 技能層 3/10->6/10(方向性)。釋出 298 軌跡可重現測試床。
AgenticSTS記憶合約型別檢索消融實驗長程 AgentSlay the Spire 2
2026-07-24 - arXiv:2607.22520 - Darshan Tank, Baran Nama (Sentient Labs)
5,832 次配對實驗:553 增益 vs 324 迴歸(59% 抵銷)。三種迴歸機制:描述滲透、接地置換、驗證置換。最好技能庫的差異在迴歸數而非增益數。方法不是瓶頸——接地與驗證才是。
回歸稅Agent Skills技能評估接地置換滲透效應驗證
2026-07-23 - arXiv:2607.16621 - MemTensor / USTC / PolyU
三層記憶架構(L1 軌跡->L2 策略->L3 環境認知),技能結晶三道閘門,反思加權價值回填。EvoAgentBench 五領域最佳,SE +15.39pp,跨域遷移 +3.93pp,終身進化 +17pp。
MSCE記憶治理技能結晶自我進化agentEMNLP 2026
2026-07-09 - arXiv:2607.08032 - UC Irvine
KV cache/Prompt/架構/Agent 四個社群共享同一 rate-distortion 公式。七軸分類法統一 ~70 方法,揭示兩個跨層失敗模式。
rate-distortion記憶壓縮KV cachesurvey資訊理論設計原則
2026-07-15 - arXiv:2607.13591 - UCLA
記憶操作建模為 MDP,tabular contextual bandit + UCB 線上學習,0 額外 LLM call。跨 6 benchmark +3 framework +3 LLM,成功率最高 +15.2 pts,token 節省 5-20%。
MemCon記憶管理MDPUCB Bandit強化學習token 節省
2026-07-14 - arXiv:2607.10183 - 南京大學
首創 tensor 粒度 hybrid CPU-GPU offloading,靜態 knapsack DP 放置 + 負載感知動態傳輸 + 非同步管線,decode 吞吐量最高 3.29x,GPU 利用率 +70%。
ATSInferhybrid inferencetensor schedulingllama.cppGPU offloading消費級裝置
2026-07-14 - arXiv:2607.12650 - ICML 2026 TAIGR
Lean 4 kernel 作為唯一 Verified 鑄幣廠,mkVerified 規則保證所有輸出可追溯至工具調用。120/120 TableBench + 100% source-faithful,兩條安全定理。
EG-VAR形式驗證幻覺消除Lean 4ICML 2026agent safety
2026-07-13 - arXiv:2607.05029 - Penn State
FARMA forges agent reasoning traces (not facts), achieves 100% ASR defeating keyword filter and A-MemGuard. SENTINEL 5-layer Reasoning Guard drops ASR to 0% with zero false positives on 326 benign traces.
FARMASENTINELmemory attackreasoning forgeryagent securityPenn State
2026-07-09 - arXiv:2607.08716 - Meta AI
behavioral state decay: info still in context but no longer influences decisions. Independent memory agent + 3-tier bank + two-phase intervention. Sonnet 4.5 +8.3pp. Selective silence beats always-on injection.
Proactive Memorybehavioral state decaymemory interventionlong-horizonMeta AITerminal-Bench
2026-07-08 - arXiv:2607.07321 · 人民大學/阿里巴巴
非參數自演化:不修改模型權重,只迭代優化工具集。Constructor-Merger-Evaluator-Reviewer 四階段生命週期,GPT-4o ACEBench +3.4%、Multi-Turn +7.2%。
EvoSOP工具自演化SOP非參數學習agent 架構ACEBench
2026-06-29 - arXiv:2606.29778
Mandol 用 SemanticMap + SemanticGraph 原生融合 KV/向量/圖結構,檢索完全不經 LLM,LoCoMo 與 LongMemEval 雙 SOTA,5.4 倍檢索加速、4.8 倍寫入加速。
Mandol聚合記憶SemanticMap代理記憶長對話去LLM檢索
2026-07-03 - arXiv:2607.01224 · Stanford
記憶管理不是被動存儲,而是可獨立訓練的認知技能(metamemory)。雙迴圈自動化優化讓 32B 開源模型 2-4 倍提升後媲美 Claude Opus 4.5。
AutoMemmetamemory記憶技能雙迴圈Stanfordself-improvement
2026-07-06 - arXiv:2607.04617 · NxtLab Innovations
個人化不是存更多對話——MRMS 提出雙軸記憶基板(表徵軸+時間軸)+ 三軸同步管線(資格→召回→裁決→暴露),從架構設計原則重新定義 agent 記憶。
MRMS記憶架構多解析度長期代理認識論標籤閘控投影
2026-07-02 - arXiv:2607.01071 · Xiamen University
七套記憶系統全軍覆沒:檢索越強,諂媚越嚴重。DeepSeek 準確率 -18%、諂媚率 +24%,記憶系統缺乏「不信任自己記憶」的能力。
記憶諂媚MemSyco-Bench記憶安全信任分數基準測試
arXiv:2606.14249 · Xiaomi · 2026-06-12
HarnessX 提出 Agent harness 組裝代數與 AEGIS 自演化引擎,從 execution trace 自動改善 prompt、工具、記憶配置,平均 +14.5%、最高 +44%。
HarnessX自演化RLAgentXiaomi
2026-06-25 - arXiv:2606.26806
代理記憶瓶頸不是「能不能查到」而是「該不該記住」——EVAF 用驚喜-效價雙閘門 LoRA 固化,目標持久性 0.812-0.904,每 200 事件僅 2-3 次寫入。
記憶深度參數固化EVAFLoRA長期代理
2026-06-18 · arXiv:2606.15971
不建全域知識圖譜,查詢時用 SQL JOIN 動態串聯事件;Hermes 選 SQLite 是對的,但現在不急著改。
RAGSQL記憶架構HermesSAGfact_store
n8n Blog, Composio, Towards AI · 2026-06-11
三大廠同步推出自家 Agent SDK,舊框架被迫轉入防禦。從生產可靠性、可觀測性、成本控制、確定性組件四個維度實戰評測。
AI AgentSDKLangGraphProduction
Google DeepMind Blog · 2026-06-05
QAT 品質完勝傳統 PTQ,行動端專用量化格式把 Gemma 4 E2B 文字版壓到 <1GB,手機原生執行 LLM 成真。
量化邊緣部署GemmaQATGoogle
arXiv:2605.06716 · Jinghao Luo et al. · 2026-05-07
Storage → Reflection → Experience 三階段演化框架,只有體驗階段代理才真正從過去「學習」。
agent-memoryevolutionexperience-learningsurvey
arXiv:2605.26099 · CMU/Maryland · 2026-05-25
記憶不是瓶頸,算力才是。讓模型在清空 KV cache 前多跑幾圈,把上下文真正「消化」。
SSMsleepfast-weights長上下文
2026-06-01 · arXiv:2605.22502
把 LangGraph/CrewAI 等 agent 框架的外部編排邏輯直接微調進小模型 weights,保險理賠 55 節點實測接近 frontier 品質,成本降 100 倍。
AI AgentFine-tuning成本優化LLM工作流程
2026-05-29 · arXiv:2605.30711
von Mises-Fisher 新穎性偵測 + 自適應閘門,即插即用 A-Mem 省 16-18% LLM 呼叫品質不降。
memorywrite-controlnovelty-detectionvMFSAGEA-MemDuke
2026-05-31 · arXiv:2605.28773
記憶不該是靜態倉庫——三階段異質圖演化讓 LoCoMo 達 95.06(vs 81.23),三基準全 SOTA。
記憶演化異質圖FluxMem程序性記憶阿里巴巴浙江大學
2026-05-30 · arXiv:2605.15701
港中深+華為提出 H-Mem:短期記憶逐步演化為長期摘要,保留實體關係圖,在代理記憶 QA 任務達 SOTA。
記憶演化知識圖時間樹華為agent-memoryH-Mem
2026-05-30 · arXiv:2605.11032
Microsoft 提出可攜記憶協議,讓不同 LLM 代理之間能安全遷移操作上下文,解決供應商鎖定。
記憶遷移密碼學多代理Microsoft供應商鎖定
2026-05-30 · arXiv:2605.26252
記憶不該只是靜態存儲,應被視為資料管理工作負載:需要學習、上下文減少與決策稽核。
記憶管理資料庫RAGagent-memorytrust-score
2026-06-29 · MemRefine + Agent-Native Memory + Mem0
MemRefine 記憶壓縮 + Agent-Native Memory 系統評估,六條 agent 使用建議