| 时间 |
论文与摘要 |
标签 |
链接 |
| 2026-09-17 |
FINSKILLOPS: A Self-Evolving Multi-Agent System for SEC Filing QA |
 |
 |
• 提出 FINSKILLOPS,将 SEC 文件问答中有证据支撑的失败转化为可复用流程技能补丁。
• 结合限定范围的补丁生成、目标验证、保护案例回归、负对照以及版本替换和退役机制。
• 在六个金融问答基准上报告正确性提升;12 轮演化中仅将 33 个提案中的 6 个晋升为正式技能。
|
| 2026-09-17 |
LearnActCoder: Role-Aware Error Memory for Adaptive Clinical Coding Agents |
 |
 |
• 提出 LearnActCoder,将带标签病例中的错误转化为临床编码智能体可复用的角色化记忆。
• 通过 MistakeKDB 将漏报经验提供给重召回的 Coder,将误报经验提供给重精确率的 Judge。
• 回顾性 MIMIC 实验中 CPT F1 等指标有所提升,但 ICD 结果及精确率与召回率权衡表明收益依赖任务。
|
| 2026-09-17 |
LIFD: Anchored Diffusion for 3D-Aware Scene Memory in Robotic Manipulation |
 |
 |
• 提出 LIFD,通过持久化三维场景记忆支持部分可观测环境下的机器人操作。
• 结合多视角一致性监督、循环场景 token 和锚定扩散,用当前几何信息约束紧凑记忆。
• 在 LIBERO、MetaWorld 及真实机器人任务上报告性能提升,部署时只需单路 RGB、本体感知与语言指令。
|
| 2026-09-17 |
JustMem: Just-Enough Memory Access for Long-Term Conversations |
 |
 |
• 提出 JustMem,同时自适应调整长期对话记忆的搜索范围与读取保真度。
• 存储紧凑原子记忆,分别使用 LOOKUP 查找局部事实、COMPOSE 组合分散证据、REPLAY 回读原始上下文。
• 在 LoCoMo 和 LongMemEval-S 上取得对比方法中最高的平均准确率与召回率,同时减少构建和推理 token 消耗。
|
| 2026-09-17 |
The Missing Complement: State-Conditioned Minimal Sufficient Evidence for Coding Agents |
 |
 |
• 研究如何补齐代码智能体当前状态缺失的证据,检索目标是联合充分的上下文集合。
• 提出 SERBench 和 MSS-Complement,在固定检索次数与 token 预算内构建状态条件化的小规模证据集。
• 在 SERBench 上提高证据充分性,并在 AMA-Bench 上以更短回答上下文获得准确率提升。
|
| 2026-09-17 |
AdaRepair-Mem: Adaptive Experience Orchestration for Repository-Level Program Repair |
 |
 |
• 提出自适应代码修复经验编排,处理记忆覆盖不足、检索噪声和不同修复阶段的经验失衡。
• 结合覆盖感知回退、质量排序与阶段感知检索,分别支持复现、定位、补丁、改进和验证。
• 在 SWE-bench Lite 和 Verified 上改善经验不足仓库的修复表现,表明单纯增加记忆并不总能提升效果。
|
| 2026-09-17 |
On-Demand Attention: Language Models Know When to Recall |
 |
 |
• 提出 On-Demand Attention,学习语言模型在解码时何时需要回读完整历史。
• 轻量召回头根据冻结模型的隐藏状态触发全局注意力,同时保留完整 KV 缓存。
• 多个模型系列的实验显示,可恢复局部注意力损失的大部分质量,并减少全局记忆读取、加速解码。
|
| 2026-09-17 |
Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision |
 |
 |
• 提出 workspace token,将机器人任务所需的历史事件与动作编码为轻量潜在记忆。
• 训练时使用 VLM 识别任务相关历史,通过集合重建目标将信息蒸馏到记忆表示。
• 仿真和硬件实验显示策略性能提升,部署时无需在控制回路中调用 VLM 推理。
|
| 2026-09-16 |
Memory Has Geometry: Non-Uniform Geometric Memory for Long-Horizon Personalized AI |
 |
 |
• 提出几何化个性记忆观点,将个人记忆建模为非均匀动态状态空间。
• 为稳定和易变的用户属性设置不同变化速率与不确定性,将记忆访问视为基于历史轨迹的状态重建。
• 该概念论文讨论长期个性化的设计方向,摘要未报告实证基准验证结果。
|
| 2026-09-16 |
Rollback the World, Keep the Reflection: Rollback-Induced Reflection for Long-Horizon LLM Agents |
 |
 |
• 提出回滚诱导反思,使长程智能体恢复到较早环境状态时仍保留失败轨迹中的经验。
• 联合决定何时干预、回滚多远以及哪些反思记忆应在回滚后保留。
• 在三个长程任务基准与多个模型上报告收益,支持将选择性回滚与可复用反思结合。
|
| 2026-09-16 |
M-SQE: Multilingual Skill Quality Estimation for Enhancing Language Equality in Agentic Skill Use |
 |
 |
• 提出 M-SQE,在检索后评估多语言流程技能,缓解智能体技能库过度集中于英语的问题。
• 结合内在质量与任务效用两种评估,形成领域条件化得分,覆盖通用、工具使用和文化任务。
• 在三种检索器上报告提升,印地语和斯瓦希里语收益尤其明显,并在六个文化区域获得较好表现。
|
| 2026-09-16 |
Disentangling Long-Term Memory via Latent Neuro-Symbolic Reasoning |
 |
 |
• 提出面向长期个性化的潜在图记忆,将对话历史表示为解耦的概念。
• 通过稀疏自编码器形成概念节点,再使用查询条件化的边与图推理提取相关记忆。
• 在涉及显式和隐式偏好的长期个性化任务中报告提升,展示自适应潜在记忆组织的价值。
|
| 2026-09-16 |
SVMemAgent: A Streaming Video Memory Agent for Query-Agnostic Online Frame Selection |
 |
 |
• 提出 SVMemAgent,在不知道未来问题或视频总长度的情况下维护紧凑视频记忆。
• 利用多样问答奖励训练帧选择策略,决定丢弃新帧还是替换已有记忆帧。
• 在在线视频评测中优于基线,并获得有竞争力的离线表现;策略会偏好含文字等信息丰富的帧。
|
| 2026-09-16 |
Long-Lived Characters, Local Inference: Incremental Memory Maintenance for Game NPCs |
 |
 |
• 研究本地部署的混合循环注意力语言模型中,长寿命游戏角色的增量记忆维护。
• 移除失效 KV 条目并在真实序列尾部计算替换内容,同时保留循环状态与未受影响的缓存。
• 八轮脚本化维护实验支持真实尾部更新;独立块拼接或状态相减可能破坏记忆绑定与查询选择。
|
| 2026-09-16 |
Cognitive Extensions for Dual-Process Language Agents: Memory and Self-Reflection in Interactive Environments |
 |
 |
• 在基于 SwiftSage 的双过程语言智能体中,分别研究情节记忆与执行时自我反思的贡献。
• 加入显著性感知记忆写入和触发式检索,并使用有界反思模块验证与纠正执行。
• ScienceWorld 受控消融中组合系统表现最佳;单独加入反思的增益最强,记忆收益依赖执行过程的稳定性。
|
| 2026-09-15 |
Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents |
 |
 |
• 提出 EvoSkillGUI,无需训练模型即可根据执行反馈持续修订可复用 GUI 智能体技能。
• 使用多文件结构保存检索元数据、执行计划、备用定位和恢复指引,通过独立评审与受限编辑更新技能。
• 在多个模型的 MobileWorld、AndroidWorld 和 OSWorld 评测上报告提升,修订技能可迁移至相关任务。
|
| 2026-09-15 |
Collaborative Memory for Multi-Agent VLM Systems |
 |
 |
• 提出多智能体 VLM 的协作记忆框架,支持对视觉环境形成一致的共享理解。
• 通过记忆层级、共享策略和一致性机制组织观察、解释以及推理依赖。
• 讨论新证据如何触发相关信念更新;摘要主要提供设计论证,未报告量化受控实验增益。
|
| 2026-09-14 |
CoMem: Collective-Individual Memory Synergy for Evolutionary Multi-Agent Systems |
 |
 |
• 结合多智能体的个体经验与集体记忆。
• 通过私人经验沉淀及双路检索共享经过筛选的知识并保持多样性。
• ALFWorld 和 PDDL 实验报告性能提升及记忆污染减少。
|
| 2026-09-14 |
AnchorGUI: Asymmetric Memory for Dual-Scale Learning in GUI Navigation |
 |
 |
• 使用非对称视觉记忆支持 GUI 纠错及跨次学习。
• 预测误差决定选择性保留截图,并聚焦流程贡献分配。
• 四个基准报告成功率提高及次线性上下文增长。
|
| 2026-09-14 |
MessyMem: Learning-from-Doing Memory for Mobile Manipulation |
 |
 |
• 为重复移动操作任务保留交互中获取的知识。
• 具有空间依据的三维场景图连接对象属性、结果及视觉观察。
• 仿真和机器人实验展示长任务序列中的经验复用。
|
| 2026-09-14 |
EvoOntology: A Self-Evolving Ontology Layer for Data Agents |
 |
 |
• 提出 EvoOntology,为异构数据智能体构建可自演化的本体层,属于邻近的智能体知识组织方向。
• 通过 MCP 提供模式、内容与工具层,由构建智能体生成本体,并通过归因指导的编辑和成对评估持续修订。
• 摘要报告三个数据智能体基准、四个模型上的基线提升;其主要贡献是本体与数据交互,而非跨会话记忆评测。
|
| 2026-09-13 |
Pull: Lazy Materialization of Working Memory for Stateful LLM Conversations |
 |
 |
• 按需且可逆地展开对话工作记忆。
• 确定性目录让模型仅展开相关历史轮次。
• LoCoEval 报告查询上下文 token 减少超过 70%,未测得质量损失。
|
| 2026-09-12 |
When Malicious Instructions Persist: Persistent Memory Poisoning Attack on Harness-Based Agents |
 |
 |
• 研究通过智能体记忆写入而持久存在的外部指令。
• 跨会话评估改变运行框架、模型、模态及触发设置。
• 提示防御减少部分注入,但对已持久化投毒保护有限。
|
| 2026-09-12 |
GraMRAG: Orchestrating Multi-Agent Multi-Step Reasoning via Graph Memory with Reinforcement Learning |
 |
 |
• 使用图记忆协调多智能体多模态推理。
• 跟踪动作与观察依赖,并训练拓扑感知的贡献分配策略。
• 多模态基准报告复杂多步推理表现提升。
|
| 2026-09-12 |
LIMBO: Lifelong Inference-Time Memory and Budget Optimization for LLM Agents |
 |
 |
• 联合分配终身智能体的记忆回放与推理预算。
• 在线策略无需修改智能体权重即可调整资源选择。
• LifelongAgentBench 在三个基座上报告更好的成本与准确率权衡。
|
| 2026-09-11 |
CueMem: Cue-Guided Context Reconstruction for Long-Term Conversational Memory |
 |
 |
• 将存储记忆记录视为重建原始上下文的线索。
• 轮次图扩展恢复检索锚点周围的时间和语义证据。
• LoCoMo 和 LongMemEval 优于记忆基线,成本低于完整历史输入。
|
| 2026-09-11 |
LifeFuse-Mem: Lifecycle-Aware State Fusion Against Temporary Overwriting for Long-Term Memory |
 |
 |
• 区分临时信息与需要长期保留的知识。
• 通过生命周期标注训练及阶段感知读取管理专用记忆组件。
• 受控测试减少覆盖,两项公开基准保持总体竞争力。
|
| 2026-09-11 |
LifeMem: Enabling Lifelong Experience Reuse for LLM Agents |
 |
 |
• 支持智能体跨环境终身复用经验。
• 按工作流聚类交互轨迹,并为新任务检索可复用技能。
• 十个环境的实验报告遗忘减少与任务迁移改善。
|
| 2026-09-11 |
BadEngram: Backdoor Attack on Gated Memory Components in LLMs |
 |
 |
• 研究仅植入门控参数记忆组件的后门。
• 保持基座权重不变,并通过受控干预定位记忆传播路径。
• 实验在受控及生产规模模型中展示触发器依赖的攻击行为。
|
| 2026-09-10 |
Grounding Agent Memory: Environment-Probing Curation for Enterprise Agents |
 |
 |
• 利用最新环境观察校验任务后的记忆整理。
• 以只读工具核验、限定和刷新候选记忆,无需重新训练。
• CLBench 和改编 APEX 实验改善奖励并降低任务智能体成本。
|
| 2026-09-10 |
2AM: Grounding Agent-Side Memory as Guidance for Steerable Action Models in Long-Horizon Manipulation |
 |
 |
• 将操作任务记忆保留在动作策略之外的智能体中。
• 通过子任务语言及可选二维提示引导无状态 RGB 动作模型。
• LIBERO-Mem 实验改善完成度,但严格成功率仍明显较低。
|
| 2026-09-10 |
MAPLE: Memory-Augmented Planning with Language and Evolution |
 |
 |
• 在连续自然语言修改中维护优化问题状态。
• 保留可执行程序、已接受计划、历史更新及候选解。
• NLDO 实验展示有效更新及对既有搜索结果的复用。
|
| 2026-09-09 |
ROAM: Robust Organization of Atomic Memories for Agents through Semantic Relations |
 |
 |
• 通过显式语义关系组织原子记忆。
• 主记忆与证据角色将活动视图和冗余或冲突观察分离。
• 实验报告回答改善、关键证据召回提高及干扰 token 减少。
|
| 2026-09-09 |
What Should an Agent Forget? Separating What Is Stored from What Is Used |
 |
 |
• 分离保留的历史与每次回答实际使用的证据。
• 查询条件视图抑制过时事实,同时保留历史访问和关系。
• 多场景消融支持相关性筛选及显式控制被替代信息。
|
| 2026-09-09 |
Fortunate Recall: Ontology-Driven Memory Lifecycle Management for Persistent Coherence in LLMs |
 |
 |
• 利用本体指导个人事实的记忆生命周期管理。
• 通过分类衰减、替代、有效期及路由区分变化信息。
• 消融将正确率收益主要归于生命周期元数据,将校准收益归于类型划分。
|
| 2026-09-08 |
SE-GoS: Self-Evolving Graph-of-Skills for Skill Library at Scale |
 |
 |
• 根据历史执行证据演化技能检索图。
• 更新拓扑、边权和描述,无需修改技能内容或模型权重。
• SkillsBench 实验报告更高奖励及对留出任务的迁移。
|
| 2026-09-08 |
MemForest: Efficient Agent Memory Management via EventTree Partitioning and Progressive Merging |
 |
 |
• 通过事件中心树结构压缩智能体记忆。
• 利用渐进节点合并及锚点引导时间检索保留有用证据。
• 单模态和多模态实验在压缩一半记忆时保留大部分性能。
|
| 2026-09-08 |
Safe Task Planning with Long-Term Graph Memory for Embodied Agents |
 |
 |
• 利用长期语义图记忆改善具身规划安全性。
• 风险预测器根据累积观察评估动作并触发保守重规划。
• IS-Bench 和真实机器人实验报告安全成功率提高。
|
| 2026-09-08 |
CreaMem: A Scene-Aware Memory Architecture for Personalized Agents |
 |
 |
• 按生活场景划分个性化记忆。
• 情节和特征双重编码在平衡检索中融合互补视角。
• 两个记忆基准报告问答提升,多跳问题收益尤为明显。
|
| 2026-09-08 |
MemSentry: A Framework for Detecting Persistent Memory Poisoning in Agentic AI |
 |
 |
• 利用可配置安全状态标准筛查持久记忆写入。
• 信任、语义风险、依赖影响范围及访问控制产生确定性决策。
• 合成场景测试展示所建模环境中的检测能力。
|
| 2026-09-08 |
Closing the Consistency Gap: Self-Evolving Agents That Learn to Stay on Course |
 |
 |
• 将不稳定执行步骤转化为可复用情节指导。
• 一致性分析器诊断失败并存储针对性指南供后续运行使用。
• AppWorld 实验改善重复及相似任务的五次运行一致成功率。
|
| 2026-09-08 |
Experience Funnel: A State-Policy Alternating Loop for Self-Evolving Agents |
 |
 |
• 交替进行快速文本状态适应及较慢策略固化。
• 通过转移感知蒸馏内化跨状态修订仍有效的行为。
• 智能体基准报告优于仅状态或仅策略演化的方法。
|
| 2026-09-08 |
MeClear: Cooperative Game-Theoretic Attribution and Risk-Aware Memory Clearance for Long-Horizon LLM Agents |
 |
 |
• 抑制对当前查询具有负面下游效用的记忆。
• 合作归因识别单项删除筛查遗漏的交互有害证据。
• 十个记忆池报告恢复改善,无需永久修改存储。
|
| 2026-09-08 |
Procedural Graphs: Self-Evolving Execution Structures for LLM Agents |
 |
 |
• 将可复用流程表示为自演化执行图。
• 局部子图指导动作,并用验证结果筛选从成败轨迹学到的编辑。
• 多任务及多模型评估报告优于记忆基线的表现。
|
| 2026-09-07 |
Where to Look and What to Use: Retrieve-Localize-Generate for Long-Term Conversational Memory Question Answering |
 |
 |
• 分离记忆检索、证据定位及答案生成。
• 多粒度图与训练后的定位器提供紧凑且位置明确的证据。
• 四个基准的实验报告较强检索准确率及回答质量。
|
| 2026-09-07 |
MEMO: Multimodal Evidence Memory Organization for Long-Horizon LLM Agents |
 |
 |
• 在文本与视觉记忆通道间分配检索证据。
• 训练后的提取及呈现策略选择有来源的证据单元和布局。
• 四个基准报告受限记忆 token 预算下的任务表现改善。
|
| 2026-09-04 |
Linguistic Trajectory Encoding for Efficient Long-Horizon Spatial Memory in Embodied Agents |
 |
 |
• 将长期对象运动历史编码为可用语言查询的轨迹。
• 文本描述及稀疏空间、视觉锚点保留动态状态变化。
• 空间记忆基准改善长期检索,并大幅压缩轨迹。
|
| 2026-09-04 |
From Interaction Traces to Persistent Skills: Online Evolution for Computer-Use Agents |
 |
 |
• 从交互轨迹构建持久且版本化的 GUI 技能。
• 利用冻结技能库快照及评估反馈支持可审计的在线修订。
• 四个 OSWorld 领域出现条件性收益,反复编辑并不保证任务恢复。
|
| 2026-09-04 |
Forgetting Without Restarting: Execution-State Unlearning for Stateful LLM Agents |
 |
 |
• 将遗忘扩展至派生执行状态,而非仅删除存储记录。
• 根据来源恢复检查点,并通过净化回放重建受影响的后续过程。
• 行为审计以更少重算 token 达到完整重置的遗忘效果。
|
| 2026-09-04 |
Compact-Memory LLM Agents via Online Max-Member Clustering and Atom-Aware Packing |
 |
 |
• 在紧张提示词预算下优化紧凑智能体记忆。
• 最大成员在线聚类及原子感知打包控制合并与证据组装。
• AMA-Bench 实验以 32% token 成本达到完整上下文质量的 83%。
|
| 2026-09-03 |
EdgeMem: LLM-Free Agent Memory Construction and Retrieval via Evidence-Preserving Multi-Anchor Hypergraph |
 |
 |
• 以多锚点超图保留原始对话证据。
• 利用本地内容、时间及情节处理,避免生成式记忆构建。
• LoCoMo 和 LongMemEval-S 实验在无需模型管理调用时保持较强检索表现。
|
| 2026-09-03 |
RuleMem: Active Rule Memory for Long-Term Conversational Agents |
 |
 |
• 归纳可复用逻辑规则用于对话记忆推理。
• 自然语言 Horn 子句及困惑度一致性验证指导证据检索。
• LoCoMo 和 LongMemEval 评估报告相较记忆基线的较强表现。
|
| 2026-09-02 |
SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models |
 |
 |
• 将采样且带时间戳的视频历史直接输入 VLA 基座。
• 子任务隐藏状态指导动作,共享前缀预填充控制延迟。
• 四个记忆基准优于匹配的检索和压缩机制。
|
| 2026-09-02 |
CHIME: Credit-Aware Hierarchical Memory Evolution for Long-Horizon Agentic Planning |
 |
 |
• 通过归因分离规划记忆与执行记忆。
• 先判断结果归属,再写入相应经验库。
• 四个基准报告规划提升、记忆精简及跨基座迁移。
|
| 2026-09-02 |
MASkills: Continual Skills Optimization for Multi-Agent LLM Systems |
 |
 |
• 持续优化多智能体系统的流程技能。
• 利用分层贡献及动量更新指导精炼、固化、归纳和裁剪。
• HotpotQA、LoCoMo 和 GAIA 实验报告有效的持续提升。
|
| 2026-09-02 |
SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams |
 |
 |
• 将任务特定技能固化为可复用流程族。
• 通过执行验证接纳全局先验,并在本地重新生成实例细节。
• 四个基准报告迁移改善,且技能库小于逐任务存储。
|
| 2026-09-02 |
APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering |
 |
 |
• 结合轨迹记忆与流程技能支持深度研究。
• 交替强化学习训练执行、蒸馏与规划,并支持测试时适应。
• 七个基准的实验报告优于所比较最强记忆基线。
|
| 2026-09-02 |
CAPTURE: Disentangling Preference Drift from Memory Poisoning in Personalized LLM Agents |
 |
 |
• 区分真实偏好漂移、投毒及临时变化。
• 信念跟踪、多时间尺度记录、澄清及反事实审计指导更新。
• 留出测试改善个性化,但自适应攻击暴露稳健性权衡。
|
| 2026-09-02 |
MemoryLACE: Memory Lifecycle-Aware Consolidation and Evidence Retrieval |
 |
 |
• 通过稀疏局部关系建模文本记忆生命周期。
• 利用合并、替代及矛盾链接重建包含来源的证据单元。
• BEAM 和 StructMemEval 实验报告推理改善及运行时间降低。
|
| 2026-09-01 |
Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents |
 |
 |
• 研究贯穿完整记忆流程的间接投毒。
• 阶段反馈建模写入、检索及后续利用之间的相互影响。
• 跨框架评估揭示可迁移漏洞,多种受测防御仍有不足。
|
| 2026-09-01 |
EM^2Mem: Event-Centric Multimodal Memory for Large Language Models |
 |
 |
• 在检索前将多模态证据绑定至共同事件锚点。
• 事件记忆单元对齐来源、时间、关系及出处。
• 三个长视频问答基准改善准确率与证据召回并降低推理成本。
|
| 2026-09-01 |
MemoryWalker: Stop Training Agents on Contexts They Never Saw |
 |
 |
• 修正智能体历史压缩后的训练条件上下文。
• 精确树式评分与自蒸馏恢复条件一致性。
• 七个网络搜索基准报告训练与运行差距缩小及奖励提高。
|
| 2026-09-01 |
HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments |
 |
 |
• 为变化的具身环境维护时间化三维记忆。
• 语义空间图、衰减及位移感知检索定位移动对象。
• Dyna-THOR 实验提高重新定位准确率并减少探索成本。
|
| 2026-09-01 |
Making Prospective Memory SLM-Shaped: Typed Intention Stores for Small-Model Agents |
 |
 |
• 将前瞻记忆结构化为带类型的意图存储。
• 代码管理意图生命周期,小模型负责限定范围的语言决策。
• PM-Bench 实验无需微调即可明显改善延迟意图执行。
|
| 2026-08-31 |
Understanding Stage-Wise Utility-Risk Trade-offs in LLM Agent Memory |
 |
 |
• 区分记忆生命周期不同阶段的效用与风险权衡。
• 匹配正常和投毒测试改变准入、管理及检索暴露程度。
• 十一个模型发现不同风险模式,支持阶段感知控制。
|
| 2026-08-31 |
When Errors Become Memories: Causal Pathway Tracing in Multi-Turn Memory-Augmented LLMs |
 |
 |
• 追踪错误在多轮记忆系统中的传播。
• 利用反事实干预区分记忆更新与问题反馈路径。
• 实验发现潜伏错误持续存在,修复记忆可带来更强纠错效果。
|
| 2026-08-31 |
PRACTICE: From Experience to Expertise in Self-Evolving Embodied Agents |
 |
 |
• 训练技能学习器维护持久具身智能体技能。
• 结构化批量编辑及对比轨迹为冻结执行器改进技能库。
• EB-ALFRED 和 EB-Habitat 在连续更新轮次中报告提升。
|
| 2026-08-31 |
Learning What to Retain: Gated-Memory Routing for Efficient Collaboration in Multi-Agent LLM Systems |
 |
 |
• 利用可学习的紧凑执行记忆路由多智能体协作。
• 写入及检索门控过滤历史,自适应停止控制任务结束。
• 五个基准报告平均准确率提高及代码生成推理成本降低。
|
| 2026-08-30 |
AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies |
 |
 |
• 仅在物理目标经过验证达成后推进机器人进度记忆。
• 交互线索和视觉验证为冻结 VLA 建立闭环。
• 计数任务及机器人实验报告提升,摘要中部分数值缺失。
|
| 2026-08-29 |
Selective Forgetting: A Graph-Based Memory Framework for Long-Term LLM Agents |
 |
 |
• 对比图记忆、选择性裁剪与扁平检索。
• 根据新近性、频率、中心性及年龄裁剪带类型的对话图。
• 该图检索弱于匹配基线,裁剪则以有限测得损失节省存储。
|
| 2026-08-29 |
When to Adapt: Conditional Memory Adapters for Retention-Preserving Domain Specialization |
 |
 |
• 利用条件记忆适配器实现兼顾能力保留的领域适应。
• 通过局部 n-gram 匹配及可学习门控选择性注入领域知识。
• Qwen3 实验保留域外平均表现的 99.4–100.1%。
|
| 2026-08-28 |
What Makes Agent Memory Useful for Reliable Unanswerable Question Handling? |
 |
 |
• 研究记忆对识别不可回答问题的支持。
• 在不同数据集、模型及迁移设置下比较四种记忆方法。
• 流程指导比更多经验存储更易迁移,但收益仍依赖数据集。
|
| 2026-08-28 |
ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL |
 |
 |
• 学习长程智能体的主动上下文编辑策略。
• 加入规划、长期记忆和卸载工具,并通过强化学习分配动作级贡献。
• 问答和深度搜索实验报告以更小上下文获得更好表现。
|
| 2026-08-27 |
GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory |
 |
 |
• 为多模态记忆构造查询特定证据森林。
• 预算化图优化平衡直接支持、关系验证及激活成本。
• 四个基准在多个基座上报告准确率与生命周期成本权衡改善。
|
| 2026-08-26 |
Learning What to Share and What to Personalize: Hierarchical Strategy Co-Evolution for Agent Memory |
 |
 |
• 共同演化共享与用户专属记忆管理策略。
• 通过角色差异及跨层规则升降调整个体保留策略。
• 实验报告相较记忆增强个性化基线的持续收益。
|
| 2026-08-26 |
EVOMAL: Self-Poisoning in Self-Evolving Coding Agents |
 |
 |
• 研究通过智能体自编技能库传播的投毒。
• 受控代码任务追踪恶意模板如何进入新生成的持久技能。
• 实验发现移除源头后仍会传播,反制提示可减少观察到的复制。
|
| 2026-08-26 |
VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction |
 |
 |
• 为流式语音交互分离信息记忆与情感记忆。
• 并行路径支持情感归因、角色建模及流式检索。
• 实验报告个性化改善,检索延迟为 134 毫秒。
|
| 2026-08-25 |
Memory Is Not Always Needed: Characterizing Conditional Memory in Scientific Reasoning |
 |
 |
• 分析条件记忆何时帮助或干扰科学推理。
• 知识边界路由器在生成前控制记忆激活位置与强度。
• 生物和化学实验支持选择性路由优于静态记忆注入。
|
| 2026-08-25 |
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses |
 |
 |
• 结合工作状态跟踪与递归演化的经验记忆。
• 固定元智能体根据执行证据进行局部且经验证的技能更新。
• 四个长程基准在大多数模型与基准组合中报告提升。
|
| 2026-08-24 |
The Retriever Should Remember: Experience-Amortized Reranking for Long-Term Agent Memory |
 |
 |
• 记住历史相关性判断以摊薄记忆重排序成本。
• 通过因果矩阵补全融合稀疏实测评分与候选相关性估计。
• 对话实验仅直接评分少数候选即可改善准确率。
|
| 2026-08-24 |
UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models |
 |
 |
• 在单一 VLA 基座中统一多模态记忆与动作控制。
• 事件触发更新、关键帧编码及缓存保留有用视觉历史。
• 仿真及硬件测试优于固定采样和分层基线。
|
| 2026-08-24 |
Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner |
 |
 |
• 为冻结多模态模型结合示例记忆及抽象流程模式。
• 在线分类与 Shapley 归因估计规则效用以指导检索。
• MathVista、MMMU 和 MMMU-Pro 在四种基座上报告提升。
|
| 2026-08-24 |
InjecMEM: Memory Injection Attack on LLM Agent Memory Systems |
 |
 |
• 测试无需直接访问存储的单次交互记忆注入。
• 评估多个系统中后续主题相关检索及回答操纵。
• 结果显示记忆漂移下仍可持续影响,提示需要加强记忆治理。
|
| 2026-08-23 |
Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation |
 |
 |
• 结合选择性外部写入与较慢的参数固化。
• 通过模型级联路由新信息,再将高价值记忆微调进入参数。
• 作者报告冗余最多减少 68%,同时保留基线问答准确率的 98% 以上。
|
| 2026-08-23 |
HERO: Human-profile Enhanced Retrieval Optimization Framework for Long-term Agent Memory |
 |
 |
• 在用户画像引导的异构记忆图中保留原始对话。
• 查询锚点及用户画像指导迭代证据遍历。
• 两个基准报告事实推理及个性化推理改善。
|
| 2026-08-23 |
When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents |
 |
 |
• 为成功经验提炼的技能记忆加入适用边界。
• 利用条件、风险信号、规避规则及恢复说明指导选择性使用。
• AppWorld、BFCL 和 AgentDojo 实验报告可靠性与效率改善。
|
| 2026-08-23 |
CONTRAMEM: Learning Self-Evolving Procedural Memory from Contrasting Multi-Model Trajectories |
 |
 |
• 从多模型执行差异中蒸馏流程记忆。
• 通过局部整理维护可复用应用功能卡及任务技能卡。
• 留出电脑操作任务报告明显收益及跨模型迁移。
|
| 2026-08-22 |
MemGuard: Persisting Verifier Signals for LLM-Agent Memory Governance |
 |
 |
• 在智能体记忆全生命周期保留验证器信号。
• 奖励、置信度、标签及不确定性指导准入、检索、冲突处理和归档。
• 四个基准在匹配运行预算下报告成功率提高及步骤减少。
|
| 2026-08-22 |
MEMORY Wins All: Indirect Bias Injection Attacks via Social Media Feeds |
 |
 |
• 研究通过记住外部内容间接操纵立场。
• 社交信息流和邮件场景追踪摄入、整理及下游影响。
• BiasBench 报告持久效应,边界防御仅部分缓解。
|
| 2026-08-21 |
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents |
 |
 |
• 动态加权任务、子任务及动作的分层记忆。
• 通过事件更新和衰减折叠已完成工作,同时保留可恢复证据。
• GAIA-Text 实验报告准确率提高与提示词 token 减少。
|
| 2026-08-21 |
Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking |
 |
 |
• 测试超出显式提示注入内容的虚假事实记忆。
• 受控投毒比较写入筛查及来源加权检索。
• 结果揭示效用损失,以及仅内容过滤和加性来源惩罚的局限。
|
| 2026-08-21 |
ForeDreamer: A Self-Evolving Dual-Agent Memory Architecture for Future Event Prediction |
|
|
• 提出 ForeDreamer,一种面向开放网络未来事件预测的自进化双智能体记忆框架,将问题级事实记忆与跨预测任务持久化的经验记忆分离。
• 主智能体负责检索与预测,记忆处理子智能体通过 MemGuide 和可执行 MemTool 将嘈杂、受时间截点约束的网页证据转化为结构化事实记忆;文本与程序性记忆通过验证门控更新共同演化。
• 在 Qwen3.5-Flash 和 GPT-5.4-Nano 上,ForeDreamer 在 Prophet Arena 上分别取得 0.1471 和 0.1839 的 Brier 分数,在 FutureX 上分别取得 0.4108 和 0.3883 的准确率,均优于对应基准和骨干模型下最强的已有对比方法。
|
| 2026-08-20 |
Beyond Memory Majority: Latent-Source Reasoning for Multi-Agent Memory Arbitration |
 |
 |
• 防止相关联的多智能体记忆形成虚假多数。
• 利用依赖推断及来源信息估计独立来源并指导证据补充。
• 基准实验报告相较所比较基线更可靠的仲裁。
|
| 2026-08-19 |
MemFuse: Multi-Source Memory Fusion from Fragmented Observations |
 |
 |
• 将碎片观察融合为可追溯来源的情节记忆。
• 利用原子事件及融合簇在因果图中组织证据。
• MemFuseBench 在三种模型设置下报告跨来源推理改善。
|
| 2026-08-18 |
Towards Reversible Forgetting: Managing Obsolete Knowledge in Continual Enterprise AI Agents |
 |
 |
• 提出对过时企业记忆进行可逆抑制。
• 活动、休眠及退役状态结合滞回阈值与影子测试再激活。
• 主要给出概念控制器和示例,尚非广泛实验验证。
|
| 2026-08-18 |
ArborMem: Navigating Interaction States with Memory Forests |
 |
 |
• 将中断及恢复的对话表示为交互状态森林。
• 先定位活动分支,再恢复上下文并检索跨分支证据。
• 既有基准及 BranchMemEval 报告在有界读取预算下连续性改善。
|
| 2026-08-18 |
CABLE: Extending the Reach of Memory Retrieval via Complementary Antecedent-Based Linking and Expansion |
 |
 |
• 添加超出检索器语义邻域的稀疏关联。
• 经过验证的前因链接将检索种子扩展至原先遗漏的支持证据。
• 多个记忆系统在跨会话及偏好问题上报告收益。
|
| 2026-08-18 |
On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification |
 |
 |
• 重新评估基于记忆的自改进智能体可靠性。
• 重复运行及打乱任务流揭示方差和任务顺序影响。
• 更明确的任务说明仅部分缓解问题,仍存在明显脆弱性。
|
| 2026-08-17 |
HyperSkill: Self-Evolving LLM Agents via Hypergraph-Structured Skill Memory |
 |
 |
• 将流程记忆组织为子任务与技能超图。
• 双路检索及结构感知维护复用轨迹层关系。
• 三个智能体基准报告优于十种记忆基线。
|
| 2026-08-17 |
QUMem: Personalized Memory for Query-Conditioned User-State Inference in LLM Agents |
 |
 |
• 从演化的个人记忆推断查询所需用户状态。
• 类型化情节记录及顺序检索智能体判断时间和情境相关性。
• PersonaMem 和 KnowU-Bench 实验报告较强个性化表现。
|
| 2026-08-17 |
FTA-Mem: Fact-Time-Affect Anchored Memory for Low-Density Long-Term Dialogue |
 |
 |
• 围绕事实、时间及情感组织低信息密度对话记忆。
• 保持边界的分段构建连贯情境级记忆单元。
• ES-MemEval 和 LoCoMo 实验通过合适构建粒度改善记忆问答。
|
| 2026-08-17 |
MELD: A Protocol for Merging Knowledge Across Distributed Agentic Memories |
 |
 |
• 协调分布式智能体记忆,同时显式保留矛盾。
• 通过可审计补丁及复制声明状态支持合并和分区恢复。
• HotpotQA 及部署实验报告召回、存储和收敛方面的收益。
|
| 2026-08-17 |
What to Remember, What to Reveal: Privacy-Aware Memory for Conversational Agents |
 |
 |
• 分离净化后的对话记忆与精确隐私值。
• 隔离存储及同意感知检索管理敏感信息全生命周期。
• 隐私感知基准报告个性化收益及不必要暴露减少。
|
| 2026-08-17 |
Cross-Model Memory Transfer via Target-Side Reader Adaptation |
 |
 |
• 在不同基座间迁移冻结的可寻址记忆。
• 保留已学习记忆表,仅适配轻量目标端读取器。
• 受控问答实验显示读取器对齐对有效复用至关重要。
|
| 2026-08-15 |
Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents |
 |
 |
• 将嘈杂的单次执行上下文编译为可复用技能框架。
• 冻结智能体在连续任务间更新结构化流程指导。
• 五个真实任务基准评估在线跨任务适应及其影响因素。
|
| 2026-08-13 |
ERSkill: Evolving for Skill-Guided Adaptive Memory Retrieval |
 |
 |
• 共同演化可执行检索技能及查询路由器。
• 经验前缀树及分离的探索、部署前沿支持稳定更新。
• 多个记忆基准报告优于静态和自演化基线。
|
| 2026-08-13 |
Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence |
 |
 |
• 将经过验证的空间经验转化为可迁移流程记忆。
• 通过反思及结果校准的可靠性评分指导冻结视觉语言模型。
• 五个空间基准在四种基座上报告改善。
|
| 2026-08-13 |
When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory |
 |
 |
• 测试智能体直接搜索未改写的对话档案。
• 利用词法索引、会话控制、时间过滤及迭代搜索收集证据。
• MemoryAgentBench 和 LongMemEval 结果表明复杂语义索引并非总是必要。
|
| 2026-08-13 |
LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation |
 |
 |
• 在语义片段边界固化对话,避免逐轮处理。
• 类型化记录及轻量索引支持有计划的证据检索。
• LoCoMo 和 LongMemEval-S 实验减少构建 token 且不增加查询成本。
|
| 2026-08-13 |
RippleMem: From Isolated Retrieval to Associative Recollection for Long-Term Agent Memory |
 |
 |
• 以自适应联想回忆替代孤立检索。
• 线索丰富的情节锚点沿事件图关联扩展并补齐证据。
• LoCoMo 和 LongMemEval-S 实验改善准确率并降低建图成本。
|
| 2026-08-12 |
Towards a Formal Definition of Agent Memory: Basis, Span, Optimality, and the Sequential Memory Problem |
 |
 |
• 通过容量约束下的知识覆盖形式化智能体记忆。
• 顺序决策模型将写入视为动作,将查询效用视为延迟奖励。
• 《奥德赛》案例展示效用容量前沿及覆盖率与精度的差异。
|
| 2026-08-12 |
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution |
 |
 |
• 在程序演化任务间迁移任务无关的策略记忆。
• 自适应门控决定是否注入检索策略及其强度。
• 八项留出任务测试报告更快改进及更少有害迁移。
|
| 2026-08-11 |
From Faulty Memories to Corrected Actions: Dependency-Guided Rollback Repair for Memory-Augmented Agents |
 |
 |
• 在诊断记忆故障后修复回答及持久状态。
• 依赖图使无依据的后继失效,并选择性回放受影响计算。
• 受控及轨迹派生测试改善恢复,同时保留正常记忆。
|
| 2026-08-11 |
Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory |
 |
 |
• 在搜索证据变化时修复下游推理。
• 来源关联证据树支持局部修订及受影响分支裁剪。
• 四个问答及搜索基准报告在有界单步上下文下提高准确率。
|
| 2026-08-10 |
Muscle Memory for Agents: Compile not Merely Retrieve |
 |
 |
• 将重复用户意图编译为专门的可执行智能体。
• 质量门控流程挖掘历史,并通过分阶段触发匹配专家。
• 90 个场景的研究报告个性化收益及轻微准确率权衡。
|
| 2026-08-10 |
Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation |
 |
 |
• 分离学习得到的运动技能与可执行记忆管理代码。
• 代码智能体启发式及多模态完成检查引导马尔可夫式 VLA。
• RoboMemArena 报告累积和任务成功率高于所比较策略。
|
| 2026-08-10 |
MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory |
 |
 |
• 按任务选择互补记忆结构的组合。
• 先验引导搜索学习冻结读取器应使用五类证据视图中的哪些。
• AMA-Bench 报告相较全结构输入以更少 token 改善回答。
|
| 2026-08-09 |
OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies |
 |
 |
• 根据在线轨迹结果学习机器人记忆保留。
• 离线先验及价值引导更新保留显著转移与高价值经验。
• 长程操作实验通过持续记忆演化改善预训练策略。
|
| 2026-08-08 |
SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents |
 |
 |
• 在图记忆中跟踪证据来源及时间有效性。
• 类型化事实事件与规划读取检索区分更新和矛盾。
• LongMemEval-S 报告较高准确率,但使用自评且跨系统成本为估计值。
|
| 2026-08-08 |
LatticeMind: A Conflict-Aware Memory Primitive for Multi-Agent Systems |
 |
 |
• 在记忆写入阶段处理多智能体矛盾声明。
• 通过显式状态及符号检查,仅在必要时调用模型协调。
• ConflictBank 明显改善,但相较讨论式方法的规划结果不一致。
|
| 2026-08-08 |
Mitigating Over-Personalization in LLMs via Structured Memory |
 |
 |
• 研究持久用户记忆导致的过度个性化。
• 推理时按领域划分记忆,而不修改存储内容。
• PersistBench 在七个模型上减少跨领域泄漏并保持效用。
|
| 2026-08-07 |
MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents |
 |
 |
• 在持久经验之上构造任务条件工作视图。
• 轻量策略选择关系、证据范围、结果条件及粒度。
• 具身及网络智能体实验改善性能并减少记忆 token。
|
| 2026-08-07 |
Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution |
 |
 |
• 将分层规划与情节记忆结合用于软件修复。
• 规划阶段指导检索,记忆统计触发重规划及执行证据验证。
• SWE-bench Verified 报告解决问题增多、重复失败减少。
|
| 2026-08-07 |
Controlled Memory Interference in Continual LLM Agents |
 |
 |
• 诊断累积智能体记忆之间的干扰。
• 通过受控关系及更新权威信号生成针对性学习样本。
• 实验表明特定关系干扰对更新的损伤超出单纯记忆增长。
|
| 2026-08-07 |
MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents |
 |
 |
• 使教师监督与学生轨迹实际使用的记忆状态对齐。
• 重建每次调用的位置和因果可见性,再进行打包式在策略蒸馏。
• 匹配对照报告相较持续历史教师评分获得 7.0% 的 F1 提升。
|
| 2026-08-07 |
MemWM: Memory-Augmented Text-Based World Model |
 |
 |
• 使用显式转移规则及事实记忆增强文本世界模型。
• 世界记忆约束预测,检索技能指导冻结的规划策略。
• 三个环境报告状态保真度及下游任务成功率提高。
|
| 2026-08-07 |
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory |
 |
 |
• 将教师经验转化为小模型智能体的分层记忆。
• 工作流、子任务及函数记忆提供主动和错误触发指导。
• 三个工具使用基准报告 4B–8B 学生无需参数训练即可提升。
|
| 2026-08-07 |
TEPA: Revoking Stale Memories for Conflict-Robust Language Agents |
 |
 |
• 通过可撤销证据记录显式表示演化记忆的有效性。
• 同键矛盾使过时先例失效,同时保留审计历史。
• 漂移测试改善当前证据利用,多跳设置暴露额外检索瓶颈。
|
| 2026-08-06 |
Causal Episodic Memory for Feedback-Driven Agent Repair |
 |
 |
• 跨 SQL 修复轮次复用已验证纠正及失败方向。
• 在预言机反馈下按失败类型仅检索较早结束的经验。
• Spider 收益明确,BIRD 证据较弱,部分检索对照表现相近。
|
| 2026-08-06 |
SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation |
 |
 |
• 将潜在原子技能存为可检索情节记忆。
• 专家引导分段及门控将相关技能基元融入动作预测。
• 仿真及真实任务改善扩散策略和 VLA 的组合泛化。
|
| 2026-08-05 |
FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory |
 |
 |
• 在潜在 GUI 记忆中分离内容保留、读取及信任。
• 角色感知表示和状态条件门控支持冻结动作策略。
• 五个 GUI 基准改善性能并减少无关记忆的负面影响。
|
| 2026-08-05 |
MemoryCPT: An End-to-End Agent Memory Framework for Cost-Performance Trade-off |
 |
 |
• 训练记忆构建及查询时摘要以优化成本效率。
• 蒸馏与成本感知强化学习生成紧凑检索上下文。
• LoCoMo 和 LongMemEval 实验改善单位推理成本的质量。
|
| 2026-08-05 |
Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments |
 |
 |
• 分离具身世界记忆与任务进度记忆。
• 动态关联将活动目标绑定至回忆的对象、位置及证据。
• EB-ALFRED 和 EB-Habitat 在所评估基座上改善成功率。
|
| 2026-08-05 |
Hierarchical Graph Memory for LLM Agents with Path-level Localization and Rewrite |
 |
 |
• 通过局部证据路径更新分层图记忆。
• 查询及更新条件子图协调记忆单元与依赖关系改写。
• 对话和冲突感知测试报告回答质量及 token 效率改善。
|
| 2026-08-04 |
DP-MemView: A Memory Interface for Attribute-Level Transcript Privacy in Long-Term LLM Agents |
 |
 |
• 使用差分隐私保护重复记忆条件回答中的属性。
• 私有视图选择及逐属性预算限制回答模型接收的信息。
• 受控及迁移测试在明确接口契约下保留有用个性化。
|
| 2026-08-04 |
Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents |
 |
 |
• 统一管理长期记忆、活动上下文与情节历史。
• 利用局部和全局验证器及分层奖励训练七种记忆操作。
• 五个基准的实验报告准确率及 token 预算效率优势。
|
| 2026-08-04 |
Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory |
 |
 |
• 研究顺序博弈决策中的经验记忆。
• 通过赛后反思提炼可复用规则,无需修改模型参数。
• 井字棋实验显示可测收益,但整体顺序决策能力仍存在不足。
|
| 2026-08-04 |
LeanMem: Simple and Efficient Long-Term Memory for LLM Agents |
 |
 |
• 根据信息属性分离画像、事件及原始记录记忆。
• 选择性事件更新及查询相关预算避免统一处理的额外开销。
• LoCoMo 和 LongMemEval-S 实验报告低构建成本下的准确率收益。
|
| 2026-08-04 |
TARL: Transaction-Aware Reliable Ledgers for Executable Memory Management in Long-Term Agents |
 |
 |
• 将记忆更新细分为五种可执行动作,超越写入或保留二选一。
• 时间范围和来源可靠性决定声明进入接受、待定或拒绝记录。
• TARL-Mem 评估报告状态恢复改善及累积污染减少。
|
| 2026-08-03 |
When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses |
 |
 |
• 从存储状态反向审计回答草稿中的过时行为依赖。
• 经过核验的引文及时间顺序决定候选状态转移能否触发修复。
• STALE 表现改善,外部测试则限制其普遍适用性结论。
|
| 2026-08-03 |
Salami Attack: Stealthy Collusive Memory Poisoning against OpenClaw |
 |
 |
• 研究单独看似无害的记忆片段协同投毒。
• 受控社交平台设置追踪存储及独立会话中的行为影响。
• OpenClaw 评估揭示稀释和记忆防御下仍存在的组合风险。
|
| 2026-08-03 |
PGMem: Tightly Coupled Persona-Memory Graph for Lifelong Personalized Agents |
 |
 |
• 将演化的用户画像直接连接至支持事件记忆。
• 通过类型化证据边及有效性排序指导个性化检索。
• 三个小模型基准优于多类记忆表示基线。
|
| 2026-08-03 |
CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents |
 |
 |
• 通过任务反馈共同演化检索策略与记忆库。
• 交替更新路由器及记忆以控制反馈环中的非平稳性。
• 七个基准报告联合检索与记忆适应的收益。
|
| 2026-08-03 |
MemSIF: From Structured Interactions to Dual-Track Fact Memory for LLM Agents |
 |
 |
• 结合结构化交互、稳定事实及查询中形成的事实记忆。
• 主题片段与事件轨迹保留跨时间连续性。
• LoCoMo 和 LongMemEval-S 在五个基座上报告提升。
|
| 2026-08-03 |
Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents |
 |
 |
• 研究单独无害的持久经验组合后产生的安全风险。
• 通过顺序经验获取测试互补记忆如何共同改变后续行为。
• 跨框架评估揭示经验组合作为独立持久攻击面的风险。
|
| 2026-08-03 |
MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents |
 |
 |
• 在决策时仲裁长程智能体记忆的显著性。
• 功能记忆库及时间呈现门控将存储条目转化为可用行动上下文。
• 预算匹配的 ALFWorld 实验改善成功率及失败后恢复。
|
| 2026-08-03 |
EvoGraph-Mem: Failure-Aware Editable Graph Memory for Long-Term Language Agents |
 |
 |
• 通过失败感知图编辑维护可复用见解。
• 正负证据指导检索、修订、归档及新增写入。
• 多基座实验支持可编辑维护优于仅追加记忆。
|
| 2026-08-03 |
RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States |
 |
 |
• 限制记忆效用状态规模以集中稀疏学习反馈。
• 以结果和动态因子替代不断扩张的轨迹级奖励坐标。
• ALFWorld 和 LifelongAgentBench 报告更小记忆、更少调用及更好表现。
|
| 2026-08-02 |
PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents |
 |
 |
• 在固化阶段编译面向未来的多模态记忆程序。
• 问题预测、规划及验证构建可复用证据路由库。
• 多模态基准改善答案质量和视觉召回,并降低查询成本。
|
| 2026-08-02 |
TrajWiki: Source-Grounded Memory Trajectories for Long-Horizon Dialogue Agents |
 |
 |
• 将记忆存储为具有来源的演化轨迹。
• 不可变快照、声明编辑及互联百科页面支持分层检索。
• LoCoMo 和 MedMT 报告对话表现及诊断可追溯性改善。
|
| 2026-08-02 |
Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination |
 |
 |
• 协调智能体自演化中的外部记忆与参数学习。
• 根据任务路由并调度两种适应通道的知识更新。
• 实验报告相较单一通道获得更稳健的能力提升。
|
| 2026-08-02 |
Stop When Memory Suffices: Evidence-Conditioned Progressive Execution for LLM Agents |
 |
 |
• 当检索证据足够时提前终止记忆处理。
• 训练后的路由器仅将未解决查询升级至深入分析。
• AMA-Bench 和 BEAM 相较完整执行降低平均推理时间。
|
| 2026-08-02 |
V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory |
 |
 |
• 根据查询及证据模态路由多模态记忆检索。
• 轮次对齐及生成搜索锚点缓解模态和相关性差距。
• Mem-Gallery 和 LoCoMo 报告收益,含图查询改善尤为明显。
|
| 2026-07-31 |
Tokenizer-Agnostic Engram Module |
 |
 |
• 使 Engram 查表摆脱特定分词边界的依赖。
• 使用字节序列多项式哈希,让不同 n-gram 长度共享嵌入空间。
• 测试保持接近的性能,并使相同字节序列获得相同哈希。
|
| 2026-07-31 |
Reproducing LightMem: Naive RAG Is Just as Good for Memory Management |
 |
 |
• 复现 LightMem,并比较构造记忆与原始轮次检索。
• 受控改变检索器和预算以定位性能变化来源。
• 原始检索常相当或更好,构造记忆主要在紧预算下有优势。
|
| 2026-07-31 |
Zero-Mem: Zero-Token Memory Operations for LLM Agents |
 |
 |
• 在记忆操作阶段避免生成模型调用。
• 利用实体上下文图及时间层级组织原始轨迹,支持查询特定检索。
• 匹配读取器测试保持问答竞争力并减少记忆操作时间。
|
| 2026-07-31 |
Know It, Act on It: Investigating Memory Utilization in LLM Personalization |
 |
 |
• 区分知道用户偏好与实际按偏好行动。
• 配对回忆及行为测试覆盖十六个系统和五种记忆架构。
• 结果显示即使回忆出相关偏好,实际利用仍存在明显差距。
|
| 2026-07-31 |
Beyond Retrieval: Analytic Memory for Multimodal Agents |
 |
 |
• 为重复多模态观察加入分析运算。
• 具有来源的属性支持过滤、聚合、排序及时间比较。
• MemEye 和 MemGallery 报告优于侧重检索的记忆系统。
|
| 2026-07-31 |
CrystalMem: Elastic Memory for Self-Evolving LLM Agents via Knowledge Crystallization |
 |
 |
• 研究记忆预算缩减再恢复后仍残留的能力损失。
• 使用四级保真度及受资源约束的验证式记忆重建。
• 七个环境的实验报告优于所比较基线的能力恢复效果。
|
| 2026-07-30 |
ChronoMem: Version Control and Semantic Rollback for Large Language Model Agent Memory |
 |
 |
• 为智能体记忆加入语义版本控制及回滚。
• 通过完整记忆快照和混合检索将自然语言撤销请求映射至版本。
• 接触后续信息后的测试改善回滚一致问答及历史摘要。
|
| 2026-07-30 |
SKILL-KD: Contrastive Skill Distillation for LLM Agents |
 |
 |
• 从师生行为差异蒸馏显式技能补丁。
• 重新运行学生验证编辑,并通过轨迹关联固化限制技能漂移。
• 五个智能体基准报告冻结学生优于所比较适应方法。
|
| 2026-07-30 |
MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck |
 |
 |
• 通过紧凑意图行为表示检测记忆注入。
• 信息瓶颈过滤重复上下文,再进行轻量威胁分类。
• 实验降低攻击成功率并保持任务准确率及推理效率。
|
| 2026-07-30 |
RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal Reasoning |
 |
 |
• 将可复用检索策略与当前视频事实分离存储。
• 对历史轨迹的反思指导查询,生命周期策略控制经验噪声。
• 三个长视频基准报告多模态推理改善。
|
| 2026-07-30 |
MemHarness: Memory Is Reconstructed, Not Replayed |
 |
 |
• 根据当前智能体状态重构检索经验。
• 统一策略批判记忆,并通过 GRPO 学习情境化指导。
• ALFWorld 和 WebShop 实验改善性能及分布外稳健性。
|
| 2026-07-29 |
MemRetriever: Learning to Search, Reflect, and Retrieve from Long-Term Memory |
 |
 |
• 学习面向长期记忆的多步搜索和反思。
• 监督热启动及 GRPO 奖励覆盖、去噪、证据充分性和停止决策。
• 五个问答基准报告优于静态及仅监督检索。
|
| 2026-07-29 |
Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability |
 |
 |
• 系统研究文件系统中的声明性和流程记忆。
• 改变组织、工具及智能体能力以测试质量、成本和存储健康度。
• 组织结构节省搜索成本,但测得智能体未稳定将其转化为更好回答。
|
| 2026-07-29 |
Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs |
 |
 |
• 通过动作图连接情节经验与推理时搜索。
• 双路时序差分价值编码有用动作及高风险选项。
• 多个基准报告相较基础智能体的成功率和进展率提升。
|
| 2026-07-28 |
MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents |
 |
 |
• 通过交互式管理面板展示记忆价值。
• Shapley 式评估指导存储并可视化分层记忆记录。
• 学习助手应用支持比较质量、延迟及 token 用量。
|
| 2026-07-27 |
MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents |
 |
 |
• 学习可解释的检索后记忆轨迹以支持回答。
• 通过证据依据奖励优化证据计划及显式记忆动作。
• LoCoMo 和 LongMemEval-S 实验改善准确率并缩短回答上下文。
|
| 2026-07-26 |
Isolated but Exposed: Persistence-Based Memory Extraction Attack on LLM Agents |
 |
 |
• 研究通过恶意工具接口提取记忆。
• 跨会话评估测试用户记忆隔离下仍发生的数据暴露。
• 结果显示仅隔离存储不足以保护传入工具调用的数据。
|
| 2026-07-26 |
MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation |
 |
 |
• 结合情节视觉历史及紧凑流程动作用于导航。
• 金字塔记忆分辨率保留远期上下文,并降低解码开销。
• VLN-CE 实验提高成功率,推理速度快于匹配基座。
|
| 2026-07-25 |
ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control |
 |
 |
• 通过自一致支持评分筛查候选记忆写入。
• 重复判断或对数概率变体无需微调即可拦截依据不足的事实。
• 四个基座减少记忆污染,但对隐含事实存在代价。
|
| 2026-07-23 |
AttriMem: Attribution-Guided Process Feedback for Agent Memory Construction |
 |
 |
• 为记忆构建分配细粒度过程奖励。
• 强化学习中以 token 级答案归因补充全局任务奖励。
• 长对话问答实验报告泛化改善及优化更稳定。
|
| 2026-07-22 |
PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning |
 |
 |
• 以程序化方式访问完整结构化交互日志。
• 代码智能体搜索保留历史,而非依赖有损固定摘要。
• ARC-AGI-3 实验报告更高成功率及更少 token 消耗。
|
| 2026-07-20 |
Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory |
 |
 |
• 根据记忆预算压力选择保留或固化。
• 校准效用模型选择合并、抽象、改写或原始保留。
• LongMemEval 和 LoCoMo 显示紧预算利于固化,宽松预算利于保留。
|
| 2026-07-20 |
Mechanistic Attention Guidance for Agent Memory Refinement |
 |
 |
• 利用内部注意力信号改进智能体记忆。
• 片段利用模式指导编辑,并通过重新执行验证。
• 交互基准在任务结果和记忆效率上优于仅文本改进方法。
|
| 2026-07-20 |
Exploratory and Assimilating Reflection: Reflective Recall Cycle for Long-term Memory |
 |
 |
• 结合探索式检索及经验回放重排序优化。
• 迭代搜索收集反馈以更新共享全局检索策略。
• 两个对话基准报告检索改善及对噪声反馈的稳健性。
|
| 2026-07-17 |
Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents |
 |
 |
• 研究仅通过图像影响持久多模态记忆的攻击。
• 黑盒测试区分历史回忆污染与无文本依据的视觉注入。
• 五种记忆架构在攻击者无法访问文本或模型内部时仍存在漏洞。
|
| 2026-07-17 |
LazyMem: Retrieve Broadly, Construct Selectively for Efficient Long-Term Agent Memory |
 |
 |
• 将记忆构建推迟至查询明确之后。
• 训练后的小模型在并行窗口中选择性压缩广泛检索的证据。
• LongMemEval 报告紧凑上下文下的较强准确率,并可迁移至 LoCoMo。
|
| 2026-07-16 |
MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents |
 |
 |
• 评测直接、组合及休眠式记忆污染。
• 人工核验案例覆盖注入渠道、记忆介质及模型系列。
• 写入检查对直接攻击的抑制强于组合或触发式攻击。
|
| 2026-07-15 |
Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents |
 |
 |
• 学习检索、计划复用、固化及遗忘的自适应控制。
• 轻量在线上下文老虎机策略封装既有记忆后端。
• 六个基准报告更高成功率及更少 token 消耗。
|
| 2026-07-15 |
CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement Learning |
 |
 |
• 利用内在奖励与任务奖励联合训练轻量记忆管理器。
• 条件互信息不依赖采样查询,为非冗余记忆更新提供监督。
• 实验报告迁移能力及训练、推理效率改善。
|
| 2026-07-15 |
Experience Memory Graph: One-Shot Error Correction for Agents |
 |
 |
• 将智能体失败恢复表述为经验图匹配。
• 成功子图及纠正编辑路径提供可复用动作指导。
• ALFWorld 和 ScienceWorld 无需测试时反复试错即可改善恢复。
|
| 2026-07-15 |
MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning |
 |
 |
• 从累积第一视角视频形成具身动作记忆。
• 多个存储及在线、离线固化提炼可复用惯例与偏好。
• 45 小时基准和机器人演示支持超出已观察事件的记忆规划。
|
| 2026-07-14 |
Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents |
 |
 |
• 为多跳推理显式表示调查工作状态。
• 来源明确的事实、排序假设及开放问题指导搜索和作答决策。
• 五个基准显示推理链越困难,收益通常越大。
|
| 2026-07-14 |
AutoMem: A Text-Gradient Recursive Self-Improvement Framework for Automated Memory Architectures Search |
 |
 |
• 搜索适配任务的智能体记忆架构。
• 通过经验引导搜索和失败诊断优化编码、存储、检索及管理模块。
• 作者报告在六组实验设置中平均准确率提升 2.8 个百分点。
|
| 2026-07-13 |
ToolAtlas: Learning Once, Reusing Everywhere with Tool-Side Memory |
 |
 |
• 将可复用工具知识放入提供方的图记忆。
• 通过执行验证探测记录能力、失败边界及工具组合。
• MCP 基准报告收益及跨智能体、环境实例迁移。
|
| 2026-07-13 |
LightMem-Ego: Your AI Memory for Everyday Life |
 |
 |
• 为日常生活助手维护流式多模态记忆。
• 对齐第一视角音视频并写入当前、短期及长期存储。
• 手机和眼镜演示支持回忆、寻物及个性化辅助。
|
| 2026-07-12 |
The Compliance Trap: Diagnosing How AI Agents Consume Conflicting Memory |
 |
 |
• 诊断冲突记忆如何改变智能体动作轨迹。
• 通过进入、传播及恢复分析区分记忆诱发失败阶段。
• WebArena 和受控测试发现早期盲从及偏离后恢复不足。
|
| 2026-07-09 |
What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents |
 |
 |
• 通过率失真视角统一记忆压缩。
• 共享分类连接 KV 缓存、提示词、循环状态及智能体记忆。
• 指出不可逆早期删除和重复压缩评估不足等开放问题。
|
| 2026-07-09 |
Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents |
 |
 |
• 使用独立记忆智能体选择性主动提醒。
• 通过结构化状态更新判断何时干预未修改的行动智能体。
• Terminal-Bench 和 tau-squared-bench 实验优于被动或始终开启的记忆输入。
|
| 2026-07-08 |
MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning |
 |
 |
• 构建具有可学习选择机制的模块化步骤指令记忆。
• 粗到细检索扩展记忆,并训练面向正确率的轻量选择头。
• 实验报告推理准确率、效率及迁移方面的优势。
|
| 2026-07-08 |
Parametric Multimodal User Memory: Storing What Captions Cannot Carry |
 |
 |
• 保留文本描述难以承载的感知用户身份。
• 情境定位和专用身份编码器与独立事实文本存储结合。
• PerceptMem 实验展示感知记忆与事实记忆的互补作用。
|
| 2026-07-07 |
From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space |
 |
 |
• 训练智能体主动导航多粒度用户记忆金字塔。
• 记忆工具为强化学习开放相连的对话、记录、主题及画像。
• 三个记忆基准保持竞争力,并基本保留通用能力。
|
| 2026-07-07 |
MemDefrag: Latent Memory Defragmentation for Large Language Models |
 |
 |
• 无需额外训练即可整理潜在记忆碎片。
• 利用中间层注意力引导片段排序、过滤及信息感知遗忘。
• 作者报告在多轮记忆更新后获得明显更好的知识保留率。
|
| 2026-07-07 |
NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation |
 |
 |
• 使用 VLA 原生视觉编码器压缩历史相机帧。
• 先对齐单 token 帧记忆,再进行任务特定策略微调。
• 仿真及机器人实验报告较强成功率和较低额外延迟。
|
| 2026-07-06 |
Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses |
 |
 |
• 研究伪造推理历史形成的持久记忆攻击。
• 分层结构检测器筛查候选推理条目中的操纵。
• 小规模评估报告攻击减少,受测正常轨迹中未观察到误报。
|
| 2026-07-06 |
When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents |
 |
 |
• 测试通过普通外部邮件处理发生的隐蔽记忆注入。
• WhisperBench 追踪持久智能体中的静默采纳及后续影响。
• 留出评估揭示多层防御下仍存在跨系统持久风险。
|
| 2026-07-06 |
When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents |
 |
 |
• 研究工具使用型个人智能体的记忆投毒。
• 两阶段评估追踪投毒记录的初始存储及后续激活。
• 记忆保存策略和检索筛查降低攻击成功率并保持效用。
|
| 2026-07-02 |
DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models |
|
|
• DRIFTLENS 是一个无需真值标签的框架,将每个表达出的推理步骤映射到一个价值本体符号,并测量问题在"无记忆"轨迹与"注入用户属性记忆"轨迹之间的偏离,揭示出个性化记忆会悄然重塑模型的推理方式("符号漂移"),而不仅仅是其答案。
• 使用价值本体和两个漂移指标(DTW 和 SRI),在一个不可验证、与人设无关的问题基准上测量个性化 LLM 在记忆扰动下的逐实例推理稳定性,并评估基于 GRPO 和 DPO 的后训练作为缓解手段。
• 在四个 LLM 和 10 个用户属性类别上,无关的人设记忆引起中到大的推理漂移(Cohen's d ≈ 0.35–0.98);GRPO 和 DPO 都能减少漂移但均不占绝对优势(例如在 Gemma2-2B 上 GRPO 将 DTW 降至 0.186 vs. 0.309;DPO 在 Qwen3-4B 上达到 0.204)。
|
| 2026-07-02 |
InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories |
|
|
• 将持续的多模态 LLM 适应重构为预算受限的在线诱导集选择:任务增量被存储为与注意力兼容的外部 KV 记忆(一个冻结的检索键加上紧凑的逐层 KV 载荷),注入自注意力,在严格固定的记忆预算下保持骨干冻结。
• 固定占用的 MLLM 持续适应(任务增量微调、持续 VQA、领域增量、终身微调);提取可直接用于注意力的记忆条目,并通过双层优化(内层检索校准;外层权重选择)构建紧凑的诱导集。
• 在预算相当的条件下持续超越 PEFT、MoE、回放和提示检索基线;在 UCIT 上相较 HiDe-LLaVA 提升 0.88 Avg/1.12 Last,在 COIN 上提升 1.35/1.43,并将持续 VQA 的 AP 从 51.34 提升至 52.64(优于 CL-MoE),在 VQACL 上超越 QUAD。
|
| 2026-07-02 |
A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory |
|
|
• 识别出"幽灵记忆"——一种状态协调失败,其中旧的、当前的和过渡态的事实共存并误导答案——并提出 A-TMA(自适应真值维护审计),一个状态感知的叠加层,将记忆解耦为三个可诊断的层级(记忆库维护、检索、回答时消解)。
• 用户事实变化下的长期智能体记忆;A-TMA 用带类型的链接保留被取代/过渡记录(一个轻量的 Sentry 门控加上一个 Qwen2.5-3B 评判器),构建状态对齐的证据包,并将问答以显式标签为条件,同时提出一个冲突密集的新基准 LTP(LoCoMo Temporal Plus)。
• 在 LTP 上,Graphiti/Zep +A-TMA 将冲突准确率绝对提升 0.240(0.480→0.720),InsideOut+A-TMA 将准确率从 0.117 提升至 0.662;在 LoCoMo 上,Graphiti/Zep +A-TMA 将时间 F1 从 0.0295 提升至 0.1705。
|
| 2026-07-02 |
Learning User-Aware Recall: Personalized Retrieval in Long-Term Conversational Memory |
|
|
• 画像引导的个性化检索优化(PPRO)通过将派生的用户画像嵌入作为显式的个性化先验注入检索排序分数,使长期对话记忆检索既具用户感知又可优化。
• 个性化长期对话问答;PPRO 离线构建情景与语义记忆库以及用户画像,执行画像引导的双路检索,并用 GRPO 以证据检索与答案质量为奖励训练一个查询改写器,同时保持记忆库和回答模型冻结。
• 在 LoCoMo 上,PPRO 在三个骨干模型上均取得最佳总体 F1,以 7–19 个百分点胜过此前最佳的 SimpleMem(例如 GPT-4o 总体 F1 48.16 vs. 40.87);在 LongMemEval-S 上达到 81.5 的总体准确率,而最佳基线为 75.9。
|
| 2026-07-02 |
ISM: Self-Improving Strategy Memory for Continual Mathematical Reasoning |
|
|
• 智能图式记忆(ISM)是一种自演化的外部记忆,通过维护一个紧凑、有界的策略图式库(双重表示:稳定内容 + 在线自适应特征钩子),让冻结的 LLM 在硬性回合重置下提升数学推理能力,其中每次更新都由符号验证把关。
• 在参数冻结的流式回合协议下进行持续数学推理;ISM 采用两阶段检索(算子过滤 + 软打分)、对称的成功/失败学习,以及七种自我改进机制加上条件化的图式合成。
• 在 300 回合的流上,MATH-Hard 达 80.67%、OlympiadBench 达 61.67%,各以 +2.00 个百分点胜过最强基线,同时存储的图式分别减少 64% 和 86%(条目最多减少 23×),并在 OlympiadBench 上取得正向后向迁移(+0.03)。
|
| 2026-07-01 |
Multi-Head Recurrent Memory Agents |
|
|
• 将循环记忆性能分解为"捕获"与"保持",诊断出保持是主导瓶颈(由单块整体记忆造成),并提出多头循环记忆(MHM)——一个免训练框架,将记忆划分为独立的头,采用分阶段的"先选择再更新"策略,从结构上保护未选中的头不被覆写。
• 在 100K–1M token 上进行可靠的长上下文推理;MHM-LRU 是一个轻量实例,每步选择最近最少更新的头,保证各头利用均匀,零额外 token 开销且无需重训。
• 在 896K token 的 RULER-HQA 上,MHM-LRU 将保持率从小于30% 提升至 73.96%、准确率提升至 49.74%(vs. MemAgent 21.62%、原生 LLM 0.00%);在 1M token 的 BABILong 上达到 41.41% vs. MemAgent 的 25.26%,在基线崩溃之处仍保持稳定。
|
| 2026-07-01 |
AUTOMEM: Automated Learning of Memory as a Cognitive Skill |
|
|
• 通过将文件系统操作(读/写/搜索/追加/创建)提升为与任务动作并列的一等记忆动作,将记忆管理重构为一项可独立训练的"元记忆"技能,然后经由元-LLM 驱动的外层循环,沿脚手架结构与模型熟练度两个维度自动化地改进它。
• 长程程序化生成游戏(Crafter、MiniHack、NetHack);循环 1(元-LLM 修订智能体脚手架/文件模式)和循环 2(元-LLM 甄选优质记忆决策,对一个专门的"记忆专家"进行 LoRA 微调,同时游戏模型保持冻结)。
• 仅优化记忆就在 Qwen2.5-32B 基座上带来约 2×–4× 的提升——Crafter 25.0→51.36%、MiniHack 7.5→30.0%、NetHack 0.42→1.85%——使该 32B 模型达到 Claude Opus 4.5 和 Gemini 3.1 Pro Thinking 等前沿系统的水平。
|
| 2026-07-01 |
Imprint: Online Memory Compression for Long-Horizon Egocentric QA |
|
|
• Imprint 将长程第一人称记忆重构为一个在线记忆压缩问题(而非分层文本摘要),将观测表示为结构化的交互记录,并用受认知启发的重现性、近因性和独特性信号对其进行整合。
• 长程第一人称问答;通过 Qwen2.5-7B-Instruct 将字幕解析为(人物、动作、物体、时间戳)记录,将其归组为事件原型,为重要性打分,并在线整合为紧凑的面向检索的记忆。
• 在 EgoLifeQA 7 天基准上,将问答准确率从 31.0% 提升至 35.8%,将有据可依的准确率从 10.8% 提升至 64.8%(比 EgoRAG 多 6× 的证据支撑答案),同时将记忆占用降低 2.3×(109 MB vs. 254 MB)、检索延迟降低 11.8×(1.7 秒 vs. 20.1 秒/查询)。
|
| 2026-06-30 |
From Signals to Structure: How Memory Architecture Drives Language Emergence in LLM Agents |
|
|
• 证明在使用冻结 LLM 智能体的 Lewis 信号博弈中,对语言涌现而言记忆架构比信道容量更重要——一个持久的私有笔记本让智能体能够外化习得的约定,从而避免无状态智能体中出现的高容量崩溃。
• 一个双智能体指称信号博弈(发送方/接收方从零协调一套编码),用 gpt-5.4-mini 运行;在从 4 到 125 的信道容量下比较五种记忆架构(仅记忆、环境板、便签本、码本、码本元)。
• 便签本笔记实现了最可靠的协调(容量=25 时为 0.867 ± 0.023),而无状态的"仅记忆"在 cap=25 达到峰值后崩溃(cap=64 时冲突为 1.0);信息瓶颈点(cap=8)是一个双峰脆弱点,而非组合性最优点。
|
| 2026-06-30 |
The Past Is Prologue: A Plug-in Controller for Selective Updates in Sequentially Evolving LLM Memory |
|
|
• Janus 是一个与方法无关的插件式记忆控制器,把每次候选记忆更新都视为"接受/拒绝"的部署决策,将"记忆动量触发器"(何时比较新旧记忆)与由覆盖、边界和新鲜任务构成的紧凑混合评估集(在什么上比较)结合起来。
• 面向任务求解智能体的顺序演化 LLM 记忆;Janus 包裹现有的记忆更新器(如 DC-RS、ExpeL)而不改变其更新规则,利用记忆更新轨迹的方向性偏离来触发成本有界的新旧对比验证。
• 在六个数据集、两个 LLM(Qwen3-8B、DeepSeek-V4-Flash)和两个更新器上,Janus 将平均准确率提升 +2.7 至 +4.6 个百分点(例如在 Qwen3-8B 上 DC-RS 79.5→83.2、ExpeL 78.3→81.5)。
|
| 2026-06-29 |
Forensic Trajectory Signatures for Agent Memory Poisoning Detection |
|
|
• 发现一个由机制强制产生的行为不变量("发送邮件前先回忆事实"),持久性记忆投毒攻击会将其印刻在 LLM 智能体的工具调用轨迹上,从而无需访问记忆内容、模型权重或激活值,仅凭操作级工具日志即可检测。
• 通过从触发会话工具日志中提取 19 个轨迹特征并训练 LR/RF/GBM 分类器来检测记忆通道(延迟触发)投毒,在跨 9 个模型(7B–120B)的 2,520 次运行上,经 5 折交叉验证、BCa 自助法和留一模型验证进行评估。
• 单条不变量规则本身即达到 AUC=0.9563;完整的随机森林达到 AUC=0.9904(Recall 0.984),在 6/9 的跨模型留出上 AUC=1.000,并可零重训迁移到 GPT-4.1/GPT-4o;仅用前缀的变体达到 AUC=0.934,可用于在线拦截。
|
| 2026-06-29 |
Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering |
|
|
• NPM 是一个免训练框架,将智能体的程序性记忆表示为残差流中的隐式激活引导向量,而非显式文本指令,这些向量从双粒度对比经验中蒸馏而来,以克服 RAG 注入指南的"文本-动作脱节"问题。
• 面向 LLM 智能体的程序性记忆;从对比的成功/失败轨迹预先计算引导向量,然后检索并动态合成一个任务特定向量,在推理时注入以调制推理与动作选择,无需参数更新或上下文扩展。
• 在四个基准(ALFWorld、WebShop、ScienceWorld、BabyAI)上,NPM 匹敌/超越显式文本基线(例如 MiniCPM3-4B 均值 22.60→28.87;Qwen3-8B 30.63→36.32),而混合的 NPM+Workflows 设置总体最佳(Qwen3-8B 均值 41.89,ALFWorld 66.42%)。
|
| 2026-06-29 |
Mandol: An Agglomerative Agent Memory System for Long-Term Conversations |
|
|
• Mandol 将碎片化的向量/图记忆整合为统一的记忆原生架构,结合了分层记忆模型、原生融合键值/向量/图存储的凝聚式 SemanticMap/SemanticGraph 结构,以及一种无需调用 LLM 即可运行的定量检索机制。
• 长期跨会话对话记忆;用查询自适应路由、基于 MAD 的去噪/冲突消解,以及在内存统一存储(配合 DuckDB 持久化)上的 MMR token 受限上下文生成,取代 RAG 式的"先召回再排序"。
• 在 LoCoMo(92.21%)和 LongMemEval(88.40%)上取得最佳总体准确率,在 10 QPS 负载下平均检索加速约 5.4×、平均插入加速约 4.8×,相较 EverMemOS 削减 token 17.4–20.0%。
|
| 2026-06-28 |
Manufactured Confidence: How Memory Consolidation Turns Hearsay into Confident Facts |
|
|
• 诊断出"人为制造的自信"——记忆整合产品(mem0、LangMem)会把含糊、随口的言论改写成自信、带日期的独立"事实",智能体随后照单全收;表明智能体依据措辞的自信程度而非来源,且无需攻击者。
• 使用无需评判的访问控制与预算审批智能体,跨五个模型/四个供应商隔离该失败,对 mem0、LangMem 及逐字存储对照运行相同的投毒协议,并测试措辞方式、来源归属、不确定性标签以及一个保留含糊语气的抽取提示。
• mem0 和 LangMem 以 100% 的比例将含糊注入"洗白"为自信事实(逐字对照为 0%);自信措辞授予未授权访问约 0.81,而含糊语气则坍缩至约 0.00;冗余目录可将错误授予恢复为 0.00,保留含糊语气的抽取将错误授予从 0.45 降至 0.10。
|
| 2026-06-28 |
Selective Memory Retention for Long-Horizon LLM Agents |
|
|
• TraceRetain 是面向冻结 LLM 智能体的轻量级容量受限记忆保留框架,通过可解释特征(成功度、年龄、访问频率、冗余度、特异性、相似度、下游效用)为记忆条目打分,并驱逐得分最低者。
• 将外部记忆管理表述为 ALFWorld 上的容量受限保留问题(gpt-5-mini,ReAct 风格),在 75% 干扰项的噪声写入压力下,将 TraceRetain-Linear/CEM 与缓存启发式(FIFO/LRU/LFU/Random/Ebbinghaus)及无界记忆进行比较。
• 在干净的 ALFWorld 上各方法趋于饱和(47–49/50 vs. 无记忆 39/50);在噪声写入下,无界与 FIFO 的 Precision@5 崩溃,而 TraceRetain-CEM 保持稳定(16.9%→16.6%)并保住 97/100 的任务成功率,且有界 K=50 可媲美无界 K=100。
|
| 2026-06-27 |
Memory as an Attack Surface in LLM Agents: A Study on Multiple-Choice Question Answering |
|
|
• 将 LLM 智能体的外部记忆视为攻击面,表明通过普通自然语言交互插入的误导性或被污染的记忆,即使在当前查询是干净的情况下,也能悄然改变智能体的答案。
• 构建一个由规划器引导、带外部记忆的 LLM 问答智能体用于四选一多选题,然后施加两种攻击——虚假信息记忆注入和基于交互的答案选项引导——覆盖机器学习、网络安全和网络领域,在 GPT-5.4/GPT-4o mini、Gemma2-9B 和 Phi3-14B 上进行。
• 干净基线平均为 91.85%(闭卷)vs. 77.10%(开卷);虚假记忆注入导致 82/1064 个答案改变(7.80% 攻击成功率),Phi3-14B 最脆弱(网络安全领域偏移 34.48%);反馈强化对答案的偏置作用大于示例暴露。
|
| 2026-06-25 |
Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents |
|
|
• 将"取代"(保持已变更事实的当前值)确立为一种独立、可训练的失败模式,并发布 Supersede——首个奖励直接针对事实时效性而非代理指标的强化学习环境,将 FAMA 指标重构为稠密训练信号。
• 在有界、自维护的记忆下处理长多会话对话中的被取代事实;在 LongMemEval 知识更新子集上诊断该差距,并通过对 Qwen2.5-3B 进行 GRPO 微调、配以程序化的取代感知奖励来将其训练缩小。
• 有界记忆使前沿 gpt-5.4 的知识更新准确率从 92% 降至 77%(p=0.0033);随对话增长 24×,准确率进一步从 68% 降至 28%;GRPO 训练在真实未见对话上将留出的取代准确率几乎翻倍(9.0%→16.7%)。
|
| 2026-06-25 |
Temporal Validity in Retrieval Memory: Eliminating Stale-Fact Errors for AI Agents over Evolving Knowledge |
|
|
• MemStrata 通过在双时态账本中的确定性(主语、关系、宾语)取代规则来维护时效性——无需相似度阈值、读取路径上无需调用 LLM 即可淘汰陈旧事实——并有一个证明支撑:余弦相似度无法区分矛盾与重复(AUROC 0.59)。
• 在演化知识(代码重命名、配置/依赖/API 变更)下保持智能体记忆最新;像 RAG 一样存储事实以实现完整的静态召回,但对被矛盾的值进行取代,在本地 7B 模型上跨 6 个基准完全确定性地评估。
• 在静态知识上与 RAG 打平,但在演化知识上达到 0.95–1.00 准确率,而 RAG 仅为 0.20–0.47(2–5× 提升),将陈旧事实错误率从 15–40% 降至约 0%,并比 LLM 重排基线快约 8×(约 2.1 秒 vs. 约 16–18 秒)。
|
| 2026-06-24 |
Memory Makes the Difference: Evaluating How Different Memory Roles Shape Conversational Agents |
|
|
• 提出首个按功能角色划分的细粒度会话记忆分类法(回答型、澄清型、丰富型、干扰型、无关型),并配以以用户为中心、上下文感知的"LLM 作为评判者"评估框架,涵盖准确性、相关性与信息量。
• 在两个长期多会话数据集(LongMemEval-m、Long-MT-Bench+)上对会话式 RAG 进行受控对比实验,使用三种前沿 LLM 和三种检索器,改变上下文规模与记忆类型组成。
• 澄清型记忆可靠地提升事实准确性;干扰型记忆显著损害准确性/相关性;无关型记忆降低主题相关性;随上下文增长性能先升后降(信息过载),且回答型记忆始终不可或缺。
|
| 2026-06-23 |
Reasoning as Attractor Dynamics: Latent Memory Retrieval via Gibbs-Weighted Energy Minimization |
|
|
• 将 LLM 推理重新表述为从稠密联想记忆中的检索——正确推理链为平坦极小值的吸引子盆地,幻觉为尖锐极小值——并引入"Gibbs 加权盆地选择"算子,按谱熵的平方反比(W ∝ E⁻²)对采样路径重新加权。
• 数学推理(GSM8K);采样 K 条高温轨迹,将每条路径的轨迹能量计算为长度归一化的 NLL,然后通过事后 Gibbs 测度重新加权,以"弛豫"进入主导吸引子盆地。
• 在 GSM8K 上用 Phi-3.5-mini(3.8B),Gibbs 加权检索(K=12)达到 90.07%,而标准采样/多数投票为 84.69%、贪心解码为 78.4%——相较自洽性提升 +5.38%。
|
| 2026-06-23 |
ReM-MoA: Reasoning Memory Sustains Mixture-of-Agents Scaling |
|
|
• 一个记忆增强的混合智能体框架,构建于"排序推理记忆"之上,通过一个比较式的评审智能体持久地存储/排序跨层推理轨迹,并搭配"精选多样化记忆路由"以同时保持推理质量与探索多样性。
• 可扩展的多智能体 LLM 推理;每一层由评审智能体带理由地比较打分轨迹,后续智能体接收不同的高/低/对比轨迹子集,并可选地用前沿模型(GPT-5.5)LoRA 蒸馏流水线来升级评审智能体。
• 在五个推理基准(MATH、MMLU-redux、Formal Logic、CRUX、HellaSwag)上持续超越以往 MoA 变体,且差距随深度加大——例如 MATH 在 L=9 时:ReM-MoA* 84.0% vs. AttentionMoA 76.9% vs. 标准 MoA 61.0%。
|
| 2026-06-19 |
When Does Overlap Help? OSU-Mem and a Cell-Conditional Analysis of Trajectory Memory for LLM Agents |
|
|
• OSU-Mem 将智能体轨迹记忆组织为重叠的语义单元,并进行预算受限的由粗到细检索;通过单元格条件分析表明,仅当证据步骤共享工具调用或实体(T+E+)时重叠才有帮助,而当二者都不共享(T−E−)时重叠反而有害。
• 在严格 token 预算下从长程 LLM 智能体轨迹中进行预算受限检索;从实体/工具/子目标/相似度视图构建 OSU,再进行查询自适应的质心打分扩展,在合成基准、τ-bench 和 ToolBench 上以 2×2(工具/实体)交叉列联表进行评估。
• 在合成基准上,B=256 时相较最强基线 Recall +39.9%、Hit@2 +61.5%;在 τ-bench 上于 T+E+ 取胜但在 T−E− 落败;在 ToolBench 上重叠构建以单调的剂量-响应关系胜过不相交构建。
|
| 2026-05-30 |
Memory Shot for Long-Term Dialogue |
|
|
• MemShot 将原始对话片段直接渲染为结构化的视觉"记忆快照"(保留说话者轮次、时间戳和轮次边界的图像),并利用 MLLM 的内部视觉推理能力,避免了脆弱、笨重的基于文本的记忆构建。
• 长期对话记忆增强问答;将对话切分为连续片段,把每个片段渲染为分层的"标题+聊天"视觉单元,检索 top-k 单元(Qwen3-VL-Embedding-8B),并用 Qwen3-VL-Instruct MLLM(2B/8B/32B)生成答案。
• 在 LoCoMo(32B 时总体准确率 79.61)和 LongMemEval(32B 时总体准确率 74.80)上表现从有竞争力到更优,同时记忆构建速度快约 70×(≈9.56 秒),并以超过 10% 的优势击败视觉记忆基线 MemOCR。
|
| 2026-06-25 |
MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG |
|
|
• 本文研究多模态 agentic RAG 系统的红队测试问题,其攻击面同时包含检索文本、图像注入、直接用户查询以及编排器层面的工具操纵。
• MIRROR 将成功攻击轨迹组成的情景记忆库与蒙特卡洛树搜索结合:检索到的记忆提供搜索先验,而确定性的 novelty gate 阻止复用已知或已检索攻击模板。
• 在四类攻击面上,该框架通过确定性 replay 或结构化工具调用解析来验证候选攻击,使记忆引导的对抗搜索更有效,同时减少对重复模板的依赖。
|
| 2026-06-23 |
Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning |
|
|
• 本文研究 LLM Agent 的经验驱动自我演化,并指出一种“自我确认陷阱”:单代理循环可能把错误但自洽的轨迹误判为成功经验,导致错误记忆在后续检索和复用中持续累积。
• 论文提出 EDV(Execute-Distill-Verify)框架:多个异构代理先并行探索同一任务空间,第三方蒸馏代理再比较候选轨迹并生成经验候选,最后由执行组通过共识机制验证,只有通过验证的经验才会写入共享或私有记忆。
• 通过解耦执行、经验蒸馏与验证,EDV 将孤立自反思转化为协作式经验构建,并在记忆写入前过滤噪声和错误内容;在 tau2-bench、Mind2Web 与 MMTB 上的实验显示其稳定优于强基线,强调可靠记忆构建对于 Agent 自我演化的重要性。
|
| 2026-06-18 |
Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention |
|
|
• 本文提出 Grouped Query Experts(GQE),在 grouped-query attention 之上引入 mixture-of-experts 层,用于降低长上下文场景中密集 self-attention 的高昂计算成本。
• 在每个 GQA group 内,路由器为每个 token 选择 k 个 query-head experts,而所有 key-value heads 保持密集且不变;该设计保留 GQA 的 KV cache 优势,同时根据 token 难度或信息量减少活跃 query head 计算。
• 在 250M 参数规模、固定 30B token 训练预算下,GQE 在下游准确率上匹配全激活 GQA 基线,同时每个 token 仅激活一半 query heads,为更高效的长上下文处理提供了一条路径。
|
| 2026-06-18 |
Multi-Agent Transactive Memory |
|
|
• 本文提出多智能体交互记忆MATM,将异构代理生成的行动—观测轨迹组织为群体级共享记忆:生产者代理贡献执行经验,消费者代理检索既有轨迹,从而复用通常会在单次任务后被丢弃的过程性知识。
• MATM采用状态条件的键值索引,将当前任务及近期交互历史作为检索键、后续轨迹片段作为值,并进一步使用学习排序模型综合生产者可靠性、消费者特征、检索得分与轨迹属性进行个性化重排序。
• 在ALFWorld和WebArena中,检索共享轨迹能够在无需代理间直接协调或联合训练的情况下提升任务效果并减少交互步骤,且收益可覆盖不同能力水平的代理;该工作由此将个体经验记忆扩展为支持开放代理生态的集体知识基础设施。
|
| 2026-06-17 |
What Must Generalist Agents Remember? |
|
|
• 本文从形式化角度研究通用智能体为在多个环境和目标上保持近最优行为所必须保存的信息,并将观测相同但最优动作冲突的状态定义为揭示记忆必要性的观测瓶颈。
• 分离定理表明,当不同领域在该瓶颈处要求互不兼容的最优动作时,任何统一近最优策略都必须形成不同的记忆分布;因此,仅依赖当前观测的无记忆策略无法同时维持高成功率和跨领域鲁棒性。
• 论文进一步证明,若记忆足以估计一组相关目标的价值函数,则可由其近似恢复局部转移动力学,使记忆同时承担领域消歧、环境模型重构与规划基质的功能;这些结论属于理论必要性结果,并不直接指定具体的工程记忆架构。
|
| 2026-06-17 |
User as Engram: Internalizing Per-User Memory as Local Parametric Edits |
|
|
• 本文将个性化记忆拆分为用户特定内容与跨用户共享推理技能,并提出在Engram模型的哈希键记忆表中以局部行编辑保存用户事实,同时由单一共享适配器承担事实解释和间接推理能力。
• 与对全局权重产生稠密影响的每用户LoRA不同,局部Engram编辑仅在精确触发位置生效,不改变其他位置;不同用户的事实写入互不重叠的哈希槽,因此能够在共享表中实现可加、无损的多用户组合。
• 论文报告该设计在直接召回上匹配每用户LoRA,间接推理准确率平均提高5.6倍,记忆占用约缩小33000倍,并在约100条事实后超过使用更大模型的检索流水线;其适用性则依赖底层模型具备可编辑的Engram记忆结构。
|
| 2026-06-16 |
Closing the Feedback Loop: From Experience Extraction to Insight Governance in Verbal Reinforcement Learning |
|
|
• 本文指出,无参数更新的言语强化学习在非平稳环境中面临“保留—遗忘”两难:长期保留失效规则会产生负迁移,而永久删除旧知识又会在相似条件重现时造成灾难性遗忘。
• 作者提出由规则、证据和技能组成的三层记忆架构,并以反馈驱动的策展循环连接三层:规则蒸馏经验,证据记录规则跨回合的可靠性,技能负责规则选择、冲突消解与必要时的拒绝决策。
• 金融预测案例显示,相同的累积经验在缺少治理时可能使表现低于零样本基线,而加入策展循环后能够改善预测准确率与风险调整后收益,说明智能体持续学习的关键瓶颈不仅是经验提取,更是知识生命周期与应用权限的治理。
|
| 2026-06-16 |
Memory as a Wasting Asset: Pricing Flash Endurance for Embodied Agents, and the Limits of Doing So |
|
|
• 本文将机器人闪存的有限擦写寿命建模为不可再生的折旧资本,引入耐久性影子价格η,并据此构造磨损增强的每字节索引,以优化记忆在RAM、板载非易失存储与云端之间的层级放置。
• 理论分析表明,阈值式放置策略在不同价值—写入相关性χ下均可实现成本最优;只有当χ为正时,最优策略才可能呈现非单调性,即将写入频繁的高价值记忆移出本地闪存。真实日志显示χ在循环性长程操作、短程任务和非循环遥操作中分别表现为正、近零和负。
• 耐久性约束在高端约3000次P/E的TLC器件上通常不活跃,却可能约束约1000次P/E的QLC或eMMC设备;论文同时明确指出,磨损感知主要改善设备寿命和成本,尚未证明能够提升任务价值或任务成功率。
|
| 2026-06-15 |
Posterior Twins: Distributional Behavioral Simulation for Enterprise Decisions |
|
|
• 本文提出Posterior Twins,将企业数字孪生的输出从单一最可能行为扩展为特定决策情境下的后验行为分布,以刻画不同群体的接受、流失、犹豫和风险迁移状态。
• 该系统以受治理的历史记忆为证据基础,并结合行为模型路由、场景编排、分布聚合及审计机制;评估同时使用模态准确率与Wasserstein-1距离,以区分点预测正确性和总体分布保真度。
• 在226个留出样本上,TL-Twin Alpha取得论文结果集中最低的Wasserstein-1距离1.16,而Gamma与Delta表现出较均衡的运行点;研究说明企业模拟需要分布性评估,但其结论仍受单一基准规模与特定系统配置限制。
|
| 2026-06-15 |
Trust-Aware Multi-Agent Traceability: Confidence-Calibrated Knowledge Graphs for Consistent Software Artifact Management |
|
|
• 本文面向多智能体软件工程流水线中的错误级联问题,以共享知识图谱同时充当集中式语义记忆和协调界面,使下游智能体能够依据经校准的置信度评估并继承上游产物。
• 方法包含嵌入检索与大模型多准则分析组成的两阶段可追溯链接预测、用于比较生成时与验证时置信度的追踪种子机制,以及阈值门控、置信度分歧检测和冲突解决协议。
• 汽车软件工程案例及消融实验表明,置信度校准是协调协议有效运行的关键;不过其证据主要来自特定领域案例,因此更适合作为高可信多智能体工件治理的架构验证,而非对所有协作场景的普遍性结论。
|
| 2026-06-15 |
HiMPO: Hindsight-Informed Memory Policy Optimization for Less-Entangled Credit in Long-Horizon Agents |
|
|
• 本文聚焦长程智能体记忆写入中的因果信用纠缠:最终失败可能源于工具调用、噪声观测或后续推理,但轨迹级奖励却容易错误惩罚此前正确的记忆更新。
• HiMPO首先在相同写入前状态下比较新旧记忆可恢复的任务相关信息,以估计记忆更新的局部效用;随后利用有界的事后相关性滤波器校准该效用,并仅将记忆特定优势施加于记忆token。
• 在开放域评测与压缩记忆问答任务中,该方法优于多种记忆及强化学习基线;受控干预进一步表明,HiMPO能够减少由工具错误引起的责任泄漏,提高记忆写入归因的准确性与可解释性。
|
| 2026-06-15 |
User as Code: Executable Memory for Personalized Agents |
|
|
• 本文提出“用户即代码”范式,将个性化智能体的用户模型实现为持续演化的软件项目:类型化Python对象保存用户状态,普通函数编码约束、聚合逻辑与响应规则,使记忆表示与记忆推理共享同一可执行介质。
• 系统采用只增事实日志与周期性代码检查点构成的两阶段流水线,既保留原始历史,又将其整理为可验证的结构化状态,从而支持矛盾处理、跨记录聚合以及由状态变化主动触发的安全规则。
• UaC在LOCOMO上的普通事实召回率达到78.8%,而在历史聚合问题上达到约99%,显著高于检索式记忆的6%—43%;其核心贡献不只是提高召回,而是将用户记忆从被动查询数据库扩展为可确定性执行的主动服务系统。
|
| 2026-06-15 |
TokenPilot: Cache-Efficient Context Management for LLM Agents |
|
|
• 本文指出,传统上下文剪枝与动态记忆驱逐虽然减少了输入令牌,却会改变序列边界和提示布局,造成前缀不匹配与KV缓存失效,因此上下文稀疏性与缓存连续性之间存在系统性张力。
• TokenPilot采用双粒度管理策略:全局的Ingestion-Aware Compaction在信息进入上下文时压缩环境噪声并稳定提示前缀,局部的Lifecycle-Aware Eviction则根据上下文片段的剩余任务效用执行保守的批次化卸载。
• 在PinchBench和Claw-Eval的独立及连续运行模式中,论文报告成本降幅分别覆盖56%—61%和61%—87%,同时维持与既有系统相当的任务性能,说明缓存友好的稳定布局是长程智能体成本优化中的独立设计目标。
|
| 2026-06-14 |
FragFuse: Bypassing Access Control of Large Language Model Agents via Memory-Based Query Fragmentation and Fusion |
|
|
• 本文揭示长期记忆为智能体访问控制引入了跨轮次时间通道:原本会触发拒绝的违规请求可被拆分为表面无害的片段,分别写入记忆,并在后续检索阶段重新融合。
• FragFuse包含拒绝敏感片段识别、基于标记载体的记忆注入以及融合式检索攻击三个阶段,并通过代理模型优化融合指令与标记设计,使攻击生成能够在黑盒威胁模型下自动化。
• 论文报告平均访问控制绕过率为86.3%,端到端有害任务成功率为41.1%,且提示注入检测器和困惑度检测器难以有效防御;结果表明安全审查必须覆盖记忆写入、存储、检索和融合的完整生命周期,而不能只检查当前用户查询。
|
| 2026-06-14 |
DYNA: Dynamic Episodic Memory Networks for Augmenting Large Language Models with Temporal Knowledge Graphs in Continuous Learning |
|
|
• 本文提出DYNA,以冻结的大语言模型为推理核心,并将事件建模为节点、将“先于”“后于”及“共现”等时间关系建模为带时间戳的有向边,从而构建可持续更新的外部情景记忆。
• 在查询阶段,系统利用随机游走、节点中心性及图结构信息定位相关事件,再将检索结果与模型内部知识联合用于回答,避免了持续微调所需的训练成本及参数级知识干扰。
• 在三类时间记忆任务中,论文报告DYNA相较微调约降低7%的灾难性遗忘,并相较标准RAG约提升5%的时间排序准确率;图聚类系数与检索效果的正相关进一步说明,记忆拓扑结构本身是性能的重要决定因素。
|
| 2026-06-12 |
AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition |
|
|
• 本文提出AgentSpec,将具身智能体形式化为由感知、记忆、推理、反思、行动与可选学习模块构成的类型化组合,并通过标准化接口支持组件的独立替换、消融和受控重组。
• 研究在DeliveryBench、ALFRED、MiniGrid与RoboTHOR上系统比较不同推理、记忆、反思及强化学习组件,表明智能体性能并非由单一模块强度决定,而显著受模块兼容性、任务环境及交互效应影响。
• 实验尤其显示,结构化多粒度记忆能够更稳定地支持长程状态跟踪,但其收益依赖于记忆表示与下游推理策略的匹配;该工作由此将智能体支架从经验性工程配置转化为可分析的组合设计空间。
|
| 2026-06-11 |
EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments |
|
|
• 本文提出EvoArena基准,用于模拟动态环境变化,系统评估LLM代理在环境演化下的记忆能力与鲁棒性。
• 提出EvoMem基于“补丁式更新”的记忆范式,显式记录记忆随时间变化的结构化演化历史。
• 实验表明现有代理在动态环境中表现较弱,而EvoMem显著提升性能,强调建模环境演化的重要性。
|
| 2026-06-11 |
MemRefine: LLM-Guided Compression for Long-Term Agent Memory |
|
|
• 本文提出MemRefine框架,在固定记忆预算下通过LLM驱动的判断机制优化记忆保留、删除与合并策略。
• 利用语义与事实一致性评估,迭代压缩长期记忆,同时尽量保留对未来任务有价值的信息。
• 实验表明该方法在严格存储约束下仍能保持甚至超过基线性能。
|
| 2026-06-11 |
Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents |
|
|
• 本文提出TRACE方法,将用户历史纠正编译为运行时约束,用于指导LLM代理未来行为。
• 该机制将用户反馈转化为可执行规则,实现持续的行为修正与偏好记忆。
• 实验表明TRACE显著降低偏好违反率,并提升代理在交互式任务中的可靠性。
|
| 2026-06-11 |
G-Long: Graph-Enhanced Memory Management for Efficient Long-Term Dialogue Agents |
|
|
• 本文提出G-Long,通过图结构三元组建模与关系检索实现高效长期对话记忆管理。
• 使用轻量模型进行结构化信息抽取,并引入注意力感知的重要性评分机制。
• 在降低计算成本的同时,实现更稳定、更高质量的记忆检索与生成性能。
|
| 2026-06-11 |
Multi-Turn Reasoning When Context Arrives in Pieces: Scalable Sharding and Memory-Augmented RL |
|
|
• 本文研究多轮对话中信息分片输入导致的推理困难,提出紧凑滚动记忆机制替代完整历史上下文。
• 通过低成本分片训练策略提升模型在多轮、长上下文任务中的推理能力。
• 结果显示学习压缩记忆可提升零样本泛化能力,即使恢复完整上下文仍优于基线。
|
| 2026-06-10 |
Arbor: Tree Search as a Cognition Layer for Autonomous Agents |
|
|
• 本文提出Arbor,将结构化树搜索作为多智能体系统的认知层与共享工作记忆。
• 通过显式搜索树演化协调多个代理,实现大状态空间中的稳定推理与优化。
• 实验证明该框架在系统性能、可重复性与推理效率方面均有显著提升。
|
| 2026-06-10 |
Substrate Asymmetry in User-Side Memory: A Diagnostic Framework |
|
|
• 本文提出用户侧记忆诊断框架,将“个性化记忆”拆解为多个正交维度,而非单一能力。
• 识别出行为一致性、事实存在与事实缺失三类核心记忆轴。
• 实验揭示不同模型在各维度存在显著不对称性,并指出对齐成本与路由问题。
|
| 2026-06-10 |
Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents |
|
|
• 本文提出HORMA,通过层次化结构组织记忆,实现类似文件系统的高效导航与检索。
• 将经验分层存储,减少无结构检索带来的延迟与信息丢失问题。
• 实验证明该方法在长任务对话中显著提升效率与任务完成质量。
|
| 2026-06-05 |
Position: Hippocampal Explicit Memory Is the Cornerstone for AGI |
|
|
• 本文从神经科学视角提出:显式记忆是推动LLM迈向AGI的关键基础能力。
• 指出隐式统计学习不足以支持长期规划、元认知与符号推理等高级能力。
• 提出构建类海马体显式记忆系统的计算需求与研究方向。
|
| 2026-06-09 |
Trace Only What You Need: Structure-Aware On-Demand Hypergraph Memory for Long-Document Question Answering |
|
|
• 本文提出DocTrace框架,通过结构感知的超图记忆支持长文档问答中的多步推理。
• 结合文档结构树与按需构建的共享记忆图,实现高效信息组织与复用。
• 在多个数据集上显著优于现有结构化RAG方法,提升复杂推理能力。
|
| 2026-06-09 |
REAL: A Reasoning-Enhanced Graph Framework for Long-Term Memory Management of LLMs |
|
|
• 本文提出REAL框架,通过时间与置信度感知的有向图管理长期对话记忆。
• 引入非破坏性更新机制,允许同一事实的多版本并存以增强鲁棒性。
• 实验显示该方法在长期记忆任务中平均性能提升约22.72%。
|
| 2026-06-09 |
Infini Memory: Maintainable Topic Documents for Long-Term LLM Agent Memory |
|
|
• 本文提出Infini Memory,将代理记忆组织为可持续维护的主题文档,而非孤立记录。
• 通过缓冲-整合机制不断修订与聚合事实,实现长期一致的语义记忆结构。
• 支持迭代式检索与工具调用式记忆读取,提升长期推理效果。
|
| 2026-06-09 |
ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning |
|
|
• 本文提出ActiveMem,通过将规划与记忆系统解耦,实现高效的长时推理与信息管理。
• 使用轻量规划器与分布式记忆并行协作,降低上下文负担与计算开销。
• 实验表明该方法在复杂任务上达到SOTA性能,并显著提升效率。
|
| 2026-06-08 |
Memory Beyond Recall: A Dual-Process Cognitive Memory System for Self-Evolving LLM Agents |
|
|
• 本文提出DCPM双过程认知记忆系统,将记忆划分为显式与隐式认知层级。
• 采用“日间写入+夜间巩固”的双模块架构,实现长期知识演化。
• 实验显示该方法在跨会话推理与隐式个性化任务中表现优异。
|
| 2026-06-10 |
MemToolAgent: Leveraging Memory for Tool Using Agents Based on Environment and User Feedback |
|
|
• 本文提出MemToolAgent,通过结构化记忆提取与检索提升工具使用型代理的任务能力。
• 将历史交互经验转化为可复用记忆条目,实现基于反馈的持续优化。
• 实验表明该方法显著提升个性化响应能力与任务准确率。
|
| 2026-06-05 |
AdMem: Advanced Memory for Task-solving Agents |
|
|
• 本文提出AdMem统一记忆框架,将语义、情节与程序记忆整合用于任务型代理。
• 通过多代理协作实现记忆生成、奖励标注与自适应检索机制。
• 实验表明该方法在长任务场景中显著提升鲁棒性与成功率。
|
| 2026-06-04 |
AdaMEM: Test-Time Adaptive Memory for Language Agents |
|
|
• 针对语言智能体在动态测试环境中难以有效利用历史经验的问题。
• 结合离线长期轨迹记忆和在线短期策略记忆,为当前决策提供自适应指导。
• 实验优于静态记忆基线,说明测试时自适应是长期智能体记忆的重要方向。
|
| 2026-06-04 |
Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents |
|
|
• 研究终身智能体何时应该查询记忆,而不是默认始终检索。
• 将经验组织为事实、情节和技能库,并把检索建模为显式策略动作。
• 在提升任务成功率的同时减少无效交互,体现主动记忆控制的价值。
|
| 2026-06-04 |
Beyond Semantic Organization: Memory as Execution State Management for Long-Horizon Agents |
|
|
• 指出仅按语义相似性组织记忆会打碎长程任务中的决策轨迹。
• 提出 MAGE 层次执行状态树,通过 grow、compress、maintain、revise 维护任务状态。
• 通过保留有效路径、隔离错误分支提升任务成功率并降低 token 消耗。
|
| 2026-06-04 |
Beyond Similarity: Trustworthy Memory Search for Personal AI Agents |
|
|
• 指出个人 AI 中基于语义相似度的记忆检索本身就是信任边界。
• 提出轻量级 MemGate,根据当前任务条件判断候选记忆是否应进入上下文。
• 在保持长期记忆效用的同时降低跨域泄漏、谄媚、工具漂移和记忆诱导越狱风险。
|
| 2026-06-04 |
EMBER: Efficient Memory via Budgeted Evidence Retention for Long-Horizon Agents |
|
|
• 关注长程智能体在固定记忆预算下应该保留哪些未来可用证据。
• 学习写入带源证据、检索键和更新元数据的 evidence capsules。
• 提升证据保留召回和回答质量,说明记忆质量关键在于预算内证据能否存活。
|
| 2026-06-04 |
Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense |
|
|
• 针对持续演化的越狱攻击,指出静态安全分类器和朴素记忆防线不足。
• 构建对比安全记忆单元,将有害请求与表面相似的良性请求成对存储。
• 提升智能体级安全防御效果,同时降低误拒率,并在记忆中毒下保持较强鲁棒性。
|
| 2026-06-04 |
Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents |
|
|
• 质疑许多记忆增强智能体采用的静态“先检索、再推理”流程。
• 将记忆表示为 Cue-Tag-Content 图,并让智能体在推理中主动重构相关路径。
• 在长期记忆基准上优于强基线,同时降低 token 和运行时间成本。
|
| 2026-06-04 |
TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory |
|
|
• 将持久化智能体记忆中的矛盾解决视为写入时一致性问题。
• 定义双时态操作代数,显式给出隔离假设、来源标注和审计行。
• 明确生产级记忆系统在信念演化或冲突时所需的正确性契约。
|
| 2026-06-03 |
ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction |
|
|
• 针对长序列决策中保留完整交互历史成本过高的问题。
• 学习递归更新的自然语言 belief state,并直接监督其中的信息内容。
• 减少摘要遗漏和更新错误,降低记忆占用,并缩小与完整上下文智能体的差距。
|
| 2026-06-03 |
PersonaTree: Structured Lifecycle Memory for Person Understanding in LLM Agents |
|
|
• 关注如何从长期交互中形成稳定的人物理解。
• 将证据、人物主张、置信度和查询条件路径组织为结构化 PersonaTree。
• 通过按查询返回所需证据深度,提升个性化理解和响应质量。
|
| 2026-06-03 |
RAMPART: Registry-based Agentic Memory with Priority-Aware Runtime Transformation |
|
|
• 面向带显式策略的 LLM 智能体运行时上下文组装问题。
• 提出基于注册表的记忆模型,包含 promote、gate、write、evict、rollback 等原语。
• 实验表明记忆块分组和优先级管理能跨模型提升任务成功率。
|
| 2026-06-03 |
Scaling Self-Evolving Agents via Parametric Memory |
|
|
• 针对检索式记忆只能影响提示、难以真正改变未来行为的局限。
• 将历史经验压缩为显式记忆,并通过轻量在线更新形成参数化记忆。
• 为部署后持续自我演化的智能体提供新的扩展方向。
|
| 2026-06-03 |
Temporal Order Matters for Agentic Memory: Segment Trees for Long-Horizon Agents |
|
|
• 指出事件顺序是长程记忆的核心,却常被相似度组织方式忽略。
• 提出 SegTreeMem 在线段树结构,在保持时间顺序的同时形成层次化记忆。
• 提升长程记忆问答表现,并证明性能依赖于记忆构建时保留时间顺序。
|
| 2026-06-03 |
Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs |
|
|
• 研究多智能体 LLM 系统中图拓扑如何影响私密信息泄漏。
• 提出 MAMA 框架,在受控合成 PII 文档上设计 Engram 植入和 Resonance 提取阶段。
• 发现连接越密、攻击者距离越近、目标中心性越高,泄漏风险越大。
|
| 2026-06-02 |
DMF: A Deterministic Memory Framework for Conversational AI Agents |
|
|
• 针对基于 LLM 摘要的会话记忆管线存在非确定性和 token 成本的问题。
• 采用经典 NLP、向量几何、数学评分、生存分数和衰减规则构建确定性流程。
• 在保持竞争性准确率的同时降低 token 使用并提升可复现性。
|
| 2026-06-02 |
InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain |
|
|
• 针对长上下文 chunk-wise 记忆智能体训练中奖励稀疏的问题。
• 使用答案条件信息增益衡量最终记忆对真实答案的支持程度。
• 为“应该保留什么信息”提供更直接的训练信号。
|
| 2026-06-02 |
MemTrain: Self-Supervised Context Memory Training |
|
|
• 针对训练记忆智能体缺乏高质量标注数据的问题。
• 在未标注语料上结合掩码重建和中间记忆回忆两个自监督目标。
• 提升长文本问答和搜索式问答中的记忆密集推理能力。
|
| 2026-06-02 |
RGMem: Renormalization Group-inspired Memory Evolution for Language Agents |
|
|
• 面向演化且可能冲突的对话证据下的长期用户状态建模。
• 采用受重整群启发的多尺度过程,通过层次粗粒化和阈值更新整合记忆。
• 相比平面检索或静态摘要,提升跨会话连续性和对变化偏好的适应能力。
|
| 2026-06-02 |
SaliMory: Orchestrating Cognitive Memory for Conversational Agents |
|
|
• 通过更显式地监督记忆操作来减少会话智能体的记忆相关失败。
• 使用分层阶段奖励和对比精炼训练过滤、整合和回忆行为。
• 提升端到端准确率和个性化效果,同时降低记忆操作错误。
|
| 2026-06-02 |
Training-Free Lexical-Dense Fusion for Conversational-Memory Retrieval |
|
|
• 研究多会话对话历史检索中词法线索与语义线索的互补性。
• 无需训练地融合 BM25 和 dense late-interaction 评分。
• 提升多跳、时间性和对抗性记忆问题上的可控、可复现检索效果。
|
| 2026-06-01 |
DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees |
|
|
• 针对智能体积累大量任务经验时的冗余和检索冲突问题。
• 将目标条件经验和场景级知识组织为残差树,并支持自组织更新。
• 实现紧凑经验重构,并提升多种交互环境中的表现。
|
| 2026-06-01 |
Memory Retrieval for Changing Preferences |
|
|
• 处理用户偏好变化时,新旧记忆可能冲突的个性化检索问题。
• 将检索表述为选择能支持潜在偏好状态判断的历史轮次。
• 在偏好密集的长上下文对话任务中优于仅依赖嵌入的检索方法。
|
| 2026-05-31 |
Don't Ask the LLM to Track Freshness: A Deterministic Recipe for Memory Conflict Resolution |
|
|
• 指出让 LLM 直接判断演化事实的新鲜度并不可靠。
• 用候选抽取和版本感知的确定性聚合替代直接判断流程。
• 提升冲突解决效果,并说明瓶颈主要在聚合而非存储。
|
| 2026-05-31 |
Honest Lying: Understanding Memory Confabulation in Reflexive Agents |
|
|
• 研究反射型智能体如何把错误自我解释存为持久记忆。
• 提出检测反思依赖的诊断信号,并用轨迹级失败提取替代开放式自我诊断。
• 减少跨环境的记忆虚构依赖,提升反射型智能体可靠性。
|
| 2026-05-31 |
Joint Agent Memory and Exploration Learning via Novelty Signals |
|
|
• 探索开放环境中记忆与探索之间的相互依赖关系。
• 利用新颖性驱动的交互联合训练记忆和探索策略。
• 提升未见环境中的泛化能力,同时减少 token 消耗。
|
| 2026-05-30 |
MemPro: Agentic Memory Systems as Evolvable Programs |
|
|
• 质疑部署后不再演化的固定记忆构建-检索管线。
• 将整个记忆系统视为可演化程序,通过版本树和失败驱动编辑持续改进。
• 证明记忆管线可通过迭代诊断和调试在多个基准上持续提升。
|
| 2026-05-07 |
Belief Memory: Agent Memory Under Partial Observability |
|
|
• 提出 BeliefMem 记忆框架,将记忆范式从存储单一的确定性结论转变为维护属性级别的信念表示,以解决部分可观测环境下的自我强化错误问题。
• 为每个属性维护多个候选结论及其概率,通过 Noisy-OR 规则融合新证据进行更新,并结合信念感知检索机制,在智能体决策时保留不确定性。
• 在 LoCoMo 和 ALFWorld 基准测试中取得了优于现有确定性记忆方法的平均性能,展现出强大的记忆纠错能力与出色的数据效率。
|
| 2026-05-07 |
MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval |
|
|
• 提出面向智能体记忆检索的推理感知重排模型系列 MemReranker(0.6B/4B),通过多阶段 LLM 知识蒸馏流水线解决传统模型过度依赖浅层语义匹配的问题。
• 结合 Elo/Bradley-Terry 校准评分、BCE 逐点蒸馏与 InfoNCE 对比微调,实现具有良好校准度的相关性打分与困难样本的区分能力。
• 在 LOCOMO、LongMemEval 等记忆检索基准上展现出 SOTA 性能,以极低的推理延迟达到了媲美 GPT-4o-mini 等大体积闭源模型的重排质量。
|
| 2026-05-07 |
Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios |
|
|
• 提出用于无限长视频推理的轻量级框架 Event-Causal RAG (EC-RAG),将视频流异步分割为语义完整的事件并抽象为状态-事件-状态 (SES) 图记忆,替代了传统的固定长度切片记忆。
• 设计双存储记忆系统 (Dual-Store Memory),结合用于语义匹配的向量数据库和用于因果拓扑检索的图数据库,在流式视频环境中实现了低开销存储与高效的跨时空记忆合并。
• 引入双向图检索策略以快速识别最相关的事件因果链,在无需对基础视频大模型进行超长序列微调的情况下,显著提升了模型在长视频因果推理上的准确率,并有效避免了上下文溢出问题。
|
| 2026-05-06 |
Tree-based Credit Assignment for Multi-Agent Memory System |
|
|
• 提出 TreeMem,一个用于多智能体记忆系统的基于树的强化学习框架,无需依赖特定任务的标注即可直接从最终下游奖励中推导出特定于智能体的信用分配。
• 将每个记忆智能体(构建器、摘要器、检索器)的输出扩展为多个后续分支,利用蒙特卡洛平均法评估中间动作对最终结果的贡献。
• 把粗粒度的最终奖励转化为细粒度的优化信号,促使异构记忆智能体实现有效的专业化分工,并在长视距基准测试中持续优于现有的强大基线方法。
|
| 2026-05-05 |
MemFlow: Intent-Driven Memory Orchestration for Small Language Model Agents |
|
|
• 提出 MemFlow,一种面向小语言模型(SLM)的免训练记忆编排框架,通过意图驱动的记忆路由取代开放式推理循环,以解决长程智能体面临的记忆失效问题。
• 设计了专门的多智能体流水线(包含路由、记忆、回答和验证智能体)与动态上下文打包机制,在严格的 token 预算下确保确定性的证据准备和具备依据的可靠响应。
|
| 2026-05-05 |
Governed Collaborative Memory as Artificial Selection in LLM-Based Multi-Agent Systems |
|
|
• 提出将受治理的协作记忆作为基于 LLM 的多智能体系统的人工选择机制,以决定哪些候选记忆能够保留并成为持久的共享制度状态。
• 引入分层记忆架构,将智能体本地记忆、共享制度记忆、归档记忆和项目连续性记忆相分离,强调通过来源保真度、选择可追溯性和角色保留能力对记忆进行评估。
|
| 2026-05-05 |
Learning to Forget -- Hierarchical Episodic Memory for Lifelong Robot Deployment |
|
|
• 提出 H²-EMV 分层情景记忆框架,用于机器人终身部署场景,利用语言模型判断相关性并选择性遗忘不重要信息以控制记忆规模。
• 结合用户反馈更新自然语言遗忘规则,实现个性化记忆管理,在保持问答准确率的同时显著减少记忆规模和查询开销。
|
| 2026-05-05 |
MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents |
|
|
• 形式化定义检索增强 Agent 持久外部记忆的多类投毒攻击场景,并提出基于语义异常检测的防御方法 MEMSAD。
• 利用梯度耦合定理证明异常分数梯度与检索目标梯度一致,实现可认证检测半径和最优校准样本复杂度。
|
| 2026-05-05 |
ScrapMem: A Bio-inspired Framework for On-device Personalized Agent Memory via Optical Forgetting |
|
|
• 提出面向资源受限边缘设备的个性化 Agent 记忆框架 ScrapMem,核心为光学遗忘压缩机制,逐步降低旧记忆分辨率以节省存储。
• 构建事件因果时序的 Episodic Memory Graph 维持语义一致性,在 ATM-Bench 上取得更优检索性能并显著降低存储开销。
|
| 2026-05-04 |
A Semantic Autonomy Framework for VLM-Integrated Indoor Mobile Robots: Hybrid Deterministic Reasoning and Cross-Robot Adaptive Memory |
|
|
• 提出用于集成VLM的室内机器人的六层语义自主栈(SAS)框架,其混合推理机制能以确定性方式解析常规指令,从而绕过大模型的推理延迟。
• 引入五大类语义记忆框架,将学习到的操作员偏好编译为共享摘要,在无需重新训练模型的情况下实现跨会话和跨机器人的知识迁移。
|
| 2026-05-04 |
The Dynamic Gist-Based Memory Model (DGMM): A Memory-Centric Architecture for Artificial Intelligence |
|
|
• 提出了动态主旨记忆模型(DGMM),这是一种以记忆为中心的架构框架,将经验表示为显式的、持久的、基于图结构的片段-语义记忆。
• 将记忆操作形式化定义为摄入、巩固、回忆和分析四个独立机制,实现了记忆存储与下游语义解释的解耦。
• 定义了片段持久性和条件化惊讶局部性等架构不变量,使得系统无需重新训练即可基于稳定的记忆结构支持随时间演变的解释。
|
| 2026-05-04 |
MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory |
|
|
• 借鉴系统安全中的 shadow stack 思想,提出 MAGE 框架,为 LLM Agent 维护独立安全记忆,跨长任务轨迹提炼并保存关键安全上下文。
• 在执行前利用安全记忆评估待执行动作风险,能更早识别长程攻击且对 agent 效用影响很小。
|
| 2026-05-04 |
Symmetry-Protected Lyapunov Neutral Modes in Equivariant Recurrent Networks |
|
|
• 从群对称性出发证明等变循环网络中群轨道切向方向存在被对称性保护的零 Lyapunov 指数,形成长期中性记忆状态。
• 通过 S¹、T^q、SO(n)、U(m) 等系统及等变 RNN 实验验证,严格等变结构可提升长程记忆保持、泛化和稳定性。
|
| 2026-05-03 |
Planner Matters! An Efficient and Unbalanced Multi-agent Collaboration Framework for Long-horizon Planning |
|
|
• 提出面向长程规划的非均衡多智能体协作框架,将系统分为 planner、actor 和 memory manager 三角色,发现规划对任务性能贡献最大。
• 提出仅优化 planner 的强化学习方法,利用轨迹级奖励在网页导航、系统控制和工具使用等基准上验证高效性。
|
| 2026-05-02 |
MemORAI: Memory Organization and Retrieval via Adaptive Graph Intelligence for LLM Conversational Agents |
|
|
• 提出 MemORAI 记忆组织与检索框架,利用双层压缩的选择性记忆过滤机制保留与用户人设相关的核心内容,同时维持全局对话上下文。
• 构建富含溯源信息的多关系知识图谱,实现对话轮次级别的事实追踪,从而支持细粒度且透明的记忆审查。
• 引入动态加权 PageRank 进行查询自适应的子图检索,通过应用基于查询条件的边权重,显著提升上下文敏感的检索精度与个性化回复生成能力。
|
| 2026-05-01 |
From Unstructured Recall to Schema-Grounded Memory: Reliable AI Memory via Iterative, Schema-Aware Extraction |
|
|
• 指出 AI 记忆应构建为受 schema 约束的可靠外部记忆系统,提出迭代式感知 schema 的写入流程,将记忆摄取拆分为对象检测、字段检测和字段值抽取。
• 加入验证、重试与状态控制机制,在结构化抽取和端到端记忆任务上均优于基线,适合需要稳定事实和状态更新的记忆场景。
|
| 2026-05-01 |
Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory |
|
|
• 提出受认知理论启发的两阶段优化框架 MemCoE:第一阶段通过对比反馈诱导全局记忆准则,第二阶段基于准则进行多轮强化学习。
• 在三个个性化记忆基准上验证方法在偏好记忆、鲁棒性、迁移性和效率方面的提升。
|
| 2026-04-30 |
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses |
|
|
• 提出 AHE,通过可观测性驱动的闭环机制自动进化 coding agent 的 harness,从组件、经验和决策三层面构建可编辑可追踪的演化流程。
• 将大量轨迹压缩为可用证据,通过自我预测与后续结果验证实现自动迭代,显著提升编码代理性能并可迁移到不同模型家族。
|
| 2026-04-30 |
EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory |
|
|
• 提出 EviMem 框架,核心包括 IRIS 闭环迭代检索机制,通过充分性评估发现"证据缺口"并定向改写查询以处理分散的多轮证据。
• 提出 LaceMem 分层记忆架构支持由粗到细的证据诊断与检索,在 LoCoMo 上显著提升时序和多跳问题准确率并降低检索延迟。
|
| 2026-04-30 |
MemRouter: Memory-as-Embedding Routing for Long-Term Conversational Agents |
|
|
• 提出 MemRouter,用 embedding 路由替代逐轮 LLM 生成式记忆管理,仅训练约 12M 参数判断哪些轮次应写入外部记忆。
• 在保持检索管线、提示和问答骨干一致的条件下,在 LoCoMo 上优于 LLM 式记忆管理器并显著降低记忆管理延迟。
|
| 2026-04-29 |
Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture |
|
|
• 面向长期健康陪护 LLM Agent 提出双流记忆架构,将患者自述与结构化 EHR/FHIR 记录分离存储,并用 reconciliation 引擎逐条比对识别差异。
• 量化记忆抽取带来的误差级联,强调在医疗场景中进行记忆验证的必要性。
|
| 2026-04-19 |
Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents |
|
|
• 研究具身智能体在交互中忽视新观察、固守先验信念的 belief inertia 问题。
• 提出 Estimate-Verify-Update 机制,通过预测、验证和基于证据更新文本化信念状态,主动管理智能体信念并提升多个具身基准成功率。
|
| 2026-04-22 |
Memanto: Typed Semantic Memory with Information-Theoretic Retrieval for Long-Horizon Agents |
|
|
• 提出 Memanto 系统,采用 13 类 typed semantic memory schema,在 LongMemEval 和 LoCoMo 上分别达到 89.8% 和 87.1%,且无需知识图谱。
• 引入 Moorcheh Information-Theoretic Search,实现无索引、确定性检索,延迟低于 90ms,写入延迟为零。
• 通过内置冲突解决和时间版本控制机制应对 constraint drift,支持 supersede 机制保留历史状态。
|
| 2026-04-19 |
Memory Intelligence Agent |
|
|
• 提出 MIA(Memory Intelligence Agent)记忆智能体框架,采用 Manager-Planner-Executor 架构,通过将历史搜索轨迹压缩为结构化的非参数化记忆来解决存储与检索瓶颈。
• 引入两阶段交替强化学习范式以实现高层规划与底层执行的协同对齐,并设计了持续的测试时学习机制,支持在推理过程中动态更新参数化记忆。
• 结合反思机制与无监督评估框架,在多项深度研究任务中实现了SOTA性能,并展现出在不同基准测试中强大的自我进化能力。
|
| 2026-04-26 |
ZenBrain: A Neuroscience-Inspired 7-Layer Memory Architecture for Autonomous AI Systems |
|
|
• 推出 ZenBrain——一种面向自主智能体的七层长期记忆架构,融合了受神经科学启发的多种机制——包括赫布学习(Hebbian learning)、FSRS 间隔重复、睡眠周期巩固和贝叶斯置信传播——并以开源、零依赖的 TypeScript 库形式发布。
• 在 LongMemEval-500 评测中,它仅用 1/106 的 token 预算即达到 91.3% 的 oracle 准确率,并在与 Letta、Mem0 和 A-Mem 的逐一对比中取得经 Bonferroni 校正的 9/9 全胜。
|
| 2026-04-18 |
HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents |
|
|
• 提出 HeLa-Mem,借鉴联结、巩固与传播激活机制,将 LLM Agent 长期记忆建模为动态图。
• 采用情景记忆图与 Hebbian Distillation 形成的语义知识双层结构,在 LoCoMo 上提升效果并节省上下文 token。
|
| 2026-04-18 |
Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning |
|
|
• 提出 Freshness-Aware Prioritized Experience Replay,在优先级采样中加入指数式年龄衰减。
• 缓解 LLM/VLM 强化学习中策略快速变化导致旧样本优先级失效的问题,在多步推理、智能体和数学任务上优于标准 on-policy 方法与普通 PER。
|
| 2026-04-18 |
MEMRES: A Memory-Augmented Resolver with Confidence Cascade for Agentic Python Dependency Resolution |
|
|
• 提出 MEMRES,一个面向 Python 依赖解析的记忆增强型 agent 系统,采用多级置信级联机制并将 LLM 作为最后手段。
• 系统包含自我演化记忆、错误模式知识库、语义导入分析器和 Python2 启发式检测器,用于提升依赖解析成功率。
|
| 2026-04-18 |
Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning |
|
|
• 提出 Visual Inception 攻击,在用户上传图片中植入触发器,污染 Agentic 推荐系统长期记忆并在未来规划中劫持推理链。
• 提出 CognitiveGuard 双过程防御框架,结合感知净化与反事实一致性检查识别异常记忆驱动规划,显著降低攻击风险。
|
| 2026-04-18 |
On Safety Risks in Experience-Driven Self-Evolving Agents |
|
|
• 研究经验驱动自我演化 LLM Agent 在网络与具身环境中的安全风险,指出良性任务经验也可能强化“执行而非拒绝”的倾向。
• 在混合良恶任务中,拒绝相关经验可缓解安全下降但会带来过度拒绝,揭示经验记忆演化中的安全与效用权衡。
|
| 2026-04-18 |
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning |
|
|
• 提出 OASIS,用于流式视频推理的按需层级事件记忆框架,将长历史组织为层级事件。
• 先进行短上下文推理,并在不确定时触发语义检索,以高层意图驱动记忆访问,减少噪声并控制 token 成本。
|
| 2026-04-17 |
AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation |
|
|
• 提出 AdaExplore,用执行反馈中的重复失败提炼可复用有效性规则记忆,用于后续 Triton 内核生成。
• 通过树状候选组织、局部修正与结构性重生成进行多样性保留搜索,在正确性与性能优化上均有提升。
|
| 2026-04-17 |
StageMem: Lifecycle-Managed Memory for Language Models |
|
|
• 提出 StageMem,将语言模型记忆视为状态化生命周期过程,而非静态存储。
• 把记忆分为瞬时、工作和持久三层,并用置信度与强度支持低成本写入、晋升、更新与驱逐,降低深层记忆污染。
|
| 2026-04-17 |
Federation over Text: Insight Sharing for Multi-Agent Reasoning |
|
|
• 提出 FoT 框架,让多个智能体独立推理后上传轨迹,由中心服务器进行语义级聚合与提炼。
• 形成跨任务、跨领域共享洞见库,无需梯度优化或监督信号即可提升下游准确率并降低推理开销。
|
| 2026-04-13 |
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping |
|
|
• 提出了一种名为 MEDS 的记忆增强动态奖励塑造框架,将历史行为信号显式纳入奖励设计,以缓解大语言模型强化学习过程中的错误坍缩问题。
• 复用模型的逐层逻辑值(logits)作为推理轨迹的轻量级表示来构建错误记忆,并应用 HDBSCAN 聚类对频繁出现的失败模式进行动态惩罚。
• 在多个数学推理基准和基础模型上的实验表明,该方法能够一致且有效地提升模型的推理性能以及探索的多样性。
|
| 2026-04-11 |
MemCoT: Test-Time Scaling through Memory-Driven Chain-of-Thought |
|
|
• 提出了 MemCoT,将长上下文推理重构为迭代式、有状态的信息搜索过程。
• 通过多视角长期记忆感知定位证据,并用任务条件短期记忆记录搜索历史、指导后续查询分解。
• 在多个长记忆推理基准上取得了当前最优表现。
|
| 2026-04-11 |
SinkTrack: Attention Sink based Context Anchoring for Large Language Models |
|
|
• 提出了 SinkTrack,一种利用模型在 <BOS> 位置 attention sink 特性的免训练上下文锚定方法。
• 通过将关键信息注入 <BOS> 表征,使模型在生成过程中持续保留初始上下文,而非逐步遗忘。
• 在文本与多模态任务上都带来了稳定收益,并有效缓解了幻觉与上下文遗忘。
|
| 2026-04-11 |
Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems |
|
|
• 提出了 CoARS,一个面向协同演化推荐系统的自蒸馏强化学习框架。
• 该方法不再仅依赖外部文本记忆,而是通过交互奖励与自蒸馏信用分配将多轮监督转化为参数更新。
• 相比纯记忆型基线,能够进一步提升推荐质量与用户对齐效果。
|
| 2026-04-11 |
CodeComp: Structural KV Cache Compression for Agentic Coding |
|
|
• 提出了 CodeComp,一种面向代理式编程任务的结构化 KV Cache 压缩方法。
• 结合静态程序分析与代码属性图先验,保留 attention-only 压缩容易误删的结构关键信息。
• 在相同内存预算下优于仅基于 attention 的压缩方案,并可无缝集成到 SGLang 流水线。
|
| 2026-04-11 |
ClawVM: Harness-Managed Virtual Memory for Stateful Tool-Using LLM Agents |
|
|
• 提出了 ClawVM,一个面向状态型工具使用 Agent 的 harness 管理虚拟内存层。
• 它将状态组织为带类型的页,并在生命周期边界执行校验写回,以避免状态陈旧和破坏性更新。
• 在极低策略开销下显著降低了多类可控故障。
|
| 2026-04-11 |
CodaRAG: Connecting the Dots with Associativity Inspired by Complementary Learning |
|
|
• 提出了 CodaRAG,一个受互补学习启发的联想式 RAG 框架。
• 该方法通过知识整合、关联导航与干扰消除,恢复更完整的证据链并抑制噪声。
• 在检索召回与生成准确率上均优于现有方法。
|
| 2026-04-11 |
Astrolabe: A Content-Addressable Hypergraph for Semantic Knowledge Management |
|
|
• 提出了 Astrolabe,一个用于语义知识管理的内容寻址超图框架。
• 系统通过内容哈希与有序引用列表存储结构化知识,并借助插件机制解释记录内容、分解结构。
• 作者进一步展示了它在连接非正式数学与形式化数学场景中的可扩展性。
|
| 2026-04-10 |
MemReader: From Passive to Active Extraction for Long-Term Agent Memory |
|
|
• 提出了 MemReader 系列,用于长程 Agent 记忆的被动抽取与主动写入决策。
• 其中 MemReader-4B 结合 GRPO 与 ReAct 式流程,判断信息应被写入、延迟、检索还是丢弃。
• 在知识更新、时序推理与幻觉降低上优于已有方法,并已集成进 MemOS。
|
| 2026-04-10 |
HyperMem: Hypergraph Memory for Long-Term Conversations |
|
|
• 提出了 HyperMem,一个面向长程对话的超图记忆架构。
• 它通过超边建模高阶关联,并将记忆组织为主题、事件和事实三层,再结合词法-语义混合索引与粗到细检索。
• 在长对话任务中提升了记忆召回与一致性,并在 LoCoMo 上取得最佳结果。
|
| 2026-04-10 |
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding |
|
|
• 提出了 StreamMeCo,用于流式视频理解中的长期记忆压缩。
• 该方法通过边感知剪枝与孤立节点采样压缩记忆图,并结合时间衰减检索缓解压缩损失。
• 在多个基准上实现了显著的存储节省与检索加速,同时保持甚至提升准确率。
|
| 2026-04-10 |
Towards Lifelong Aerial Autonomy: Geometric Memory Management for Continual Visual Place Recognition in Dynamic Environments |
|
|
• 提出了一个面向动态环境持续视觉地点识别的几何记忆管理框架。
• 该方法将知识拆分为静态卫星锚点与动态经验回放缓存,并通过空间约束采样在有限存储下分配记忆资源。
• 它提升了长期记忆保留与空间泛化能力,并同时构建了包含 21 个任务序列的评测基准。
|
| 2026-04-10 |
SPASM: Stable Persona-driven Agent Simulation for Multi-turn Dialogue Generation |
|
|
• 提出了 SPASM,一个面向多轮对话生成的人格稳定框架。
• 系统结合人格构建、Client-Responder 对话生成以及 ECP 视角无关表示来组织历史信息。
• 能有效降低 persona drift、角色混淆与 echoing,并发布了大规模对话数据集。
|
| 2026-04-10 |
SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering |
|
|
• 提出了 SkillMOO,一个面向软件工程 Agent 技能包的多目标优化框架。
• 它结合 LLM 生成修改建议与 NSGA-II 选择策略,根据失败案例持续演化技能包。
• 实验表明,替换或裁剪指令往往比简单堆叠更多技能更有效。
|
| 2026-04-10 |
RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval |
|
|
• 提出了 RecaLLM,通过在推理过程中交替进行显式上下文检索来缓解 lost-in-thought 问题。
• 方法使用约束解码复制证据片段,并同时在词法与语义检索任务上训练模型。
• 在 RULER、HELMET 等长上下文基准上优于基线,并可扩展到 128K 上下文。
|
| 2026-04-10 |
Constraint-Aware Corrective Memory for Language-Based Drug Discovery Agents |
|
|
• 提出了一个面向药物发现语言 Agent 的约束感知纠正记忆框架。
• 它通过协议审计与约束诊断生成纠正反馈,并将结果写入静态、动态与纠正三类记忆通道。
• 通过保持规划上下文紧凑且可执行,显著提升了任务成功率。
|
| 2026-04-10 |
ADAM: A Systematic Data Extraction Attack on Agent Memory via Adaptive Querying |
|
|
• 提出了 ADAM,一种针对 Agent 记忆模块的系统化自适应查询攻击方法。
• 它通过估计受害者记忆分布并采用熵引导查询,最大化隐私泄露效果。
• 相比现有攻击方法,成功率显著更高,在部分设置下甚至可达到 100%。
|
| 2026-04-10 |
EE-MCP: Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning |
|
|
• 提出了 EE-MCP,一个面向 MCP-GUI Agent 的自进化框架。
• 该系统构建了环境生成、轨迹采集、任务合成与质量筛选的闭环,并将经验规则沉淀到 experience bank 中用于推理期改进。
• 结果显示,在 GUI 密集任务上,经验增强比纯蒸馏更有效,且无需微调模型。
|
| 2026-04-10 |
MEMENTO: Teaching LLMs to Manage Their Own Context |
|
|
• 提出了 MEMENTO,让模型学会通过中间 memento 摘要主动管理自身上下文。
• 它将长推理过程切分为多个块,并为每个块生成紧凑摘要,然后基于摘要继续推理。
• 该方法在保持推理质量的同时降低了上下文长度、KV Cache 开销与计算成本,并发布了 OpenMementos 数据集。
|
| 2026-04-10 |
Formal Architecture Descriptors as Navigation Primitives for AI Coding Agents |
|
|
• 研究了形式化架构描述符在 AI Coding Agent 中作为导航原语的作用。
• 结果表明,结构化架构上下文可以减少无目的代码库探索,并提高 Agent 行为一致性。
• 作者比较了 JSON、YAML 与 S-expression 等表示方式,并提出了 intent.lisp 与 Forge 工具链。
|
| 2026-04-09 |
Task-Adaptive Retrieval over Agentic Multi-Modal Web Histories via Learned Graph Memory |
|
|
• 提出了 ACGM,一个面向长程多模态 Web 历史的任务自适应图记忆检索器。
• 该方法通过策略梯度优化稀疏相关图,并显式建模视觉与文本观测在时间上的不同衰减规律。
• 在 WebShop、VisualWebArena 与 Mind2Web 上均优于多种基线。
|
| 2026-04-09 |
TSUBASA: Improving Long-Horizon Personalization via Evolving Memory and Self-Learning with Context Distillation |
|
|
• 提出了 TSUBASA,用于提升个性化模型的长程能力。
• 该方法通过动态记忆演化改进写入,并通过上下文蒸馏驱动的自学习机制强化读取与用户经验内化。
• 在长程个性化基准上优于 Mem0 等方案,并取得了更好的质量与效率折中。
|
| 2026-04-09 |
Dynamic Attentional Context Scoping: Agent-Triggered Focus Sessions for Isolated Per-Agent Steering in Multi-Agent LLM Orchestration |
|
|
• 提出了 DACS,一种面向多 Agent LLM 编排的动态注意力上下文作用域机制。
• 在 Registry 模式下仅保留轻量状态摘要,在 Focus 模式下只为目标 Agent 注入完整上下文、压缩其余 Agent。
• 该机制显著提升了 steering 准确率,并减少了无关 Agent 的干扰。
|
| 2026-04-09 |
LogAct: Enabling Agentic Reliability via Shared Logs |
|
|
• 提出了 LogAct,一个基于共享日志的 Agent 执行框架,将 Agent 表示为日志上的状态机。
• 它使计划动作在执行前即可被观察、拦截、恢复和回放,也支持基于历史轨迹的 LLM 自省。
• 该框架提升了 Agent 系统的可靠性、故障恢复能力与调试便利性。
|
| 2026-04-09 |
PASK: Toward Intent-Aware Proactive Agents with Long-Term Memory |
|
|
• 提出了 DD-MM-PAS 范式及其实现系统 Pask,用于构建意图感知的主动式长程记忆 Agent。
• 它结合 IntentFlow 潜在需求检测、workspace/user/global 混合记忆设计以及完整的感知-记忆-行动基础设施。
• 在低延迟约束下能识别更深层用户意图,并同步发布了 LatentNeeds-Bench。
|
| 2026-04-09 |
Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search |
|
|
• 提出了 HiExp,用于从 Agentic Search 的原始轨迹中抽取可复用经验知识。
• 它通过对比分析与分层聚类构造层级化经验表示,并进一步进行经验对齐训练。
• 该方法将随机探索转化为更具策略性的搜索过程,并提升了稳定性、性能与跨任务泛化。
|
| 2026-04-09 |
"Theater of Mind" for LLMs: A Cognitive Architecture Based on Global Workspace Theory |
|
|
• 提出了受全局工作空间理论启发的 Global Workspace Agents 认知架构。
• 该架构将中心广播枢纽、异质 Agent、熵驱动内在动机与双层记忆分叉策略结合起来。
• 在多 Agent 执行中提升了语义多样性与长期认知连续性。
|
| 2026-04-09 |
ACF: A Collaborative Framework for Agent Covert Communication under Cognitive Asymmetry |
|
|
• 提出了 ACF,一个面向认知不对称场景下记忆增强 Agent 的协同隐蔽通信框架。
• 它将隐蔽信号与语义推理解耦,并使用与前缀无关的解码方式和共享隐写配置来摆脱对称性假设。
• 即使在强认知不对称条件下,也能保持较好的语义一致性和隐蔽通信性能。
|
| 2026-04-09 |
Distributed Multi-Layer Editing for Rule-Level Knowledge in Large Language Models |
|
|
• 研究了大模型中的规则级知识编辑问题,并指出规则知识往往跨层分布而非局部集中。
• 作者扩展了 RuleEdit 基准,并通过因果追踪分析公式、描述与实例在不同层中的表征方式。
• 基于此提出 DMLE,在保持常规编辑指标竞争力的同时提升了规则迁移与理解能力。
|
| 2026-04-09 |
SkillClaw: Let Skills Evolve Collectively with Agentic Evolver |
|
|
• 提出了 SkillClaw,用于多用户 LLM Agent 环境中的集体技能演化。
• 系统持续聚合用户轨迹,识别重复行为与失败模式,并将其转化为共享技能库中的修订或新增技能。
• 该方法实现了跨用户经验迁移,并提升了真实 Agent 场景中的整体表现。
|
| 2026-04-09 |
Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing |
|
|
• 提出了 SAVeR,一个面向 LLM Agent 忠实推理的自审计框架。
• 它通过生成多样候选信念、对抗式审计和最小约束修复,在行动前校正潜在错误信念。
• 该方法减少了由不忠实推理引发的行为漂移,同时保持了较好的任务性能。
|
| 2026-04-09 |
SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support |
|
|
• 提出了 SkillForge,一个面向云技术支持场景的领域技能生成与自进化框架。
• 它将领域上下文技能创建与故障分析、技能诊断、技能重写闭环结合起来。
• 既能提升初始技能质量,也能在部署反馈中持续迭代优化。
|
| 2026-04-09 |
Efficient RL Training for LLMs with Experience Replay |
|
|
• 重新审视了 LLM 后训练中的经验回放机制,并质疑“只有新鲜 on-policy 数据才有价值”的假设。
• 论文系统分析了 replay buffer 在数据陈旧性、多样性与生成成本之间的权衡。
• 结果表明,合理设计的回放缓冲区能够显著降低推理成本,同时不损害甚至提升性能。
|
| 2026-04-09 |
Artifacts as Memory Beyond the Agent Boundary |
|
|
• 从理论上形式化了“环境可作为 Agent 外部记忆”的观点。
• 论文提出 artifact 概念,说明某些观测能够减少表示历史所需的信息量,并将其与强化学习理论联系起来。
• 实验表明,环境中的空间路径信息可降低学习高性能策略所需的内部记忆负担。
|
| 2026-04-09 |
MT-OSC: Path for LLMs that Get Lost in Multi-Turn Conversation |
|
|
• 提出了 MT-OSC,在后台自动凝练多轮聊天历史以保留关键内容。
• 该方法通过 few-shot condenser 与轻量决策模块压缩无关信息,同时保留重要事实。
• 在最多减少 72% token 的同时,仍能保持甚至提升多轮对话准确率与时延表现。
|
| 2026-04-09 |
M^\star: Every Task Deserves Its Own Memory Harness |
|
|
• 提出了 M^\star,将 Agent 记忆表示为可执行的 Python 记忆程序,而不是固定 schema。
• 它通过群体搜索与失败分析驱动的反思式代码进化,联合优化任务专属的数据结构、存储逻辑与交互流程。
• 在对话、具身规划和专家推理等任务上优于固定记忆基线,并演化出差异显著的记忆机制。
|
| 2026-04-08 |
From Business Events to Auditable Decisions: Ontology-Governed Graph Simulation for Enterprise AI |
|
|
• 提出了 LOM-action,一个面向企业可审计决策的本体约束图模拟框架。
• 它根据业务事件触发场景条件,在隔离沙箱中执行确定性图变换,并仅基于生成的场景有效图进行决策。
• 该方法在准确率和工具链 F1 上优于基线,同时能够输出完整可追溯的审计日志。
|
| 2026-04-08 |
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models |
|
|
• 提出了 LAST,一个通过“工具即提示”增强多模态空间推理的框架。
• 它通过 LAST-Box 将异构工具调用封装为可复用的空间技能,并返回模型可直接消费的多模态提示。
• 结合三阶段渐进训练后,在四个空间推理数据集上取得了显著提升。
|
| 2026-04-04 |
LightThinker++: From Reasoning Compression to Memory Management |
|
|
• 该论文提出了 LightThinker,一种通过将冗长的推理链压缩为基于 gist tokens 的紧凑隐藏状态表示,从而实现表示层级推理压缩的方法 。
• 该论文进一步提出了 LightThinker++,一种显式自适应记忆管理框架,通过 commit、expand 和 fold 等行为原语动态调节上下文分辨率,并缓解复杂场景下的信息丢失 。
• 该工作构建了专门的轨迹合成流水线来训练有目的的记忆调度,证明了该方法在标准推理和长程智能体任务中能显著降低峰值 Token 使用量并提升性能 。
|
| 2026-04-18 |
Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agents |
|
|
• 将 agent memory、skill discovery 和 rule learning 统一为经验压缩的不同层级,定义压缩函数 C_L 将轨迹映射到 L0-L3 层级的知识(原始轨迹 → 情景记忆 → 程序性技能 → 陈述性规则)。
• 揭示 memory 和 skill 社区深度割裂,22 篇核心论文中交叉引用率低于 1%(共 1136 条引用),提出全谱 agent 学习系统自适应选择压缩粒度。
• 优化目标包括减少 context 消耗、降低 retrieval latency、提高跨任务/跨模型/跨场景迁移能力;工作流遵循新问题→memory、重复模式→skill、跨场景原则→rule 的循环模式。
|
| 2026-04-03 |
Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents |
|
|
• 本论文提出了环境注入的基于轨迹的智能体记忆投毒(eTAMP),这是首个仅通过环境观测实现跨会话、跨站点劫持且无需直接访问记忆的攻击手段。
• 本研究发现了“挫败感利用”现象,即环境压力和任务失败能将代理对恶意指令的易感性显著提高多达八倍。
• 本工作引入了受混沌工程启发的 Chaos Monkey,通过模拟网络延迟和输入错误等真实部署条件,系统性地评估了大语言模型 Web 代理的鲁棒性。
|
| 2026-04-03 |
Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents |
|
|
• 识别出长程智能体失败源于两个耦合但不同的目标:全局进度对齐和局部可行性对齐 。
• 提出神经-符号双存储框架,其中包含用于阶段感知语义引导的神经进度存储和用于可执行动作验证的符号可行性存储 。
• 在包括 ALFWorld、WebShop 和 TextCraft 在内的多种基准测试中证明了优越的性能,同时显著降低了无效动作率和轨迹长度 。
|
| 2026-04-02 |
ByteRover: Agent-Native Memory Through LLM-Curated Hierarchical Context |
|
|
• 提出了一种智能体原生存储架构,由大语言模型自身负责知识的策划、组织与检索,消除了推理智能体与外部存储流水线之间的架构分离及随之产生的语义漂移。
• 引入了语境树,一种基于文件的分层知识图谱,并结合自适应知识生命周期机制,利用重要性评分、成熟度等级和新鲜度衰减来实现知识的动态演化管理。
• 设计了一套五层渐进式检索策略,通过多级缓存与索引技术优先处理查询,仅针对新颖问题启用智能体推理,从而最大限度地降低了检索延迟。
|
| 2026-04-02 |
MemFactory: Unified Inference & Training Framework for Agent Memory |
|
|
• MemFactory提出了首个统一的框架,整合了记忆增强型AI智能体的训练、评估和推理流水线。
• 该框架采用了高度模块化的架构,将存储生命周期解耦为原子化的即插即用组件,如提取器、更新器和检索器。
• 它原生集成了群体相对策略优化(GRPO),旨在通过多维环境奖励实现对内部记忆管理策略的高效微调。
|
| 2026-04-02 |
MEMRERANK: Preference Memory for Personalized Product Reranking |
|
|
• 引入了一个个性化产品重排序基准,包含用户购买历史、候选集和人工标注的相关性标签 。
• 开发了 MEMRERANK 框架,将冗长的购买历史提炼为结构化的、与查询无关的类内和跨类偏好记忆 。
• 实施了强化学习后训练目标,以优化偏好记忆提取器在下游重排序任务中的效用 。
|
| 2026-04-02 |
OMNI-SIMPLEMEM: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory |
|
|
• 论文提出了 OMNI-SIMPLEMEM,一个为终身 AI 智能体设计的统一多模态记忆框架,利用了选择性摄取、渐进式金字塔检索以及结构化知识图谱增强。
• 该系统的架构和配置通过 AUTORESEARCHCLAW 自主发现并优化,该流水线是一个具备代码修改、故障诊断和架构重构能力的自动研究平台,其功能从根本上超越了传统的自动机器学习。
• 该框架在 LoCoMo 和 Mem-Gallery 基准测试中达到了当前最优性能,证明了自主识别的错误修复和架构更改带来的性能提升显著超过了超参数调优。
|
| 2026-04-02 |
SelRoute: Query-Type-Aware Routing for Long-Term Conversational Memory Retrieval |
|
|
• 提出 SelRoute 选择性路由框架,根据特定查询类型将查询分配至专门的检索流水线,以优化长期对话记忆检索 。
• 识别出富化-嵌入不对称性,证明存储时词汇扩展能提升词法搜索性能,但同时会降低嵌入搜索的质量 。
• 在 LongMemEval_M 基准上实现了最先进的结果,且该架构仅需 CPU 运行,无需查询时的 LLM 推理,并能推广至多个基准测试 。
|
| 2026-03-31 |
Multi-Layered Memory Architectures for LLM Agents: An Experimental Evaluation of Long-Term Context Retention |
|
|
• 提出了一种多层记忆框架(MLMF),将对话历史分解为工作记忆、情节记忆和语义记忆层,以实现短期交互与长期抽象的分离 。
• 引入了自适应检索门控机制和保留稳定性目标,用以调节语义偏移并保持跨长会话的人格一致性 。
• 通过在长程基准测试上的实验验证了该框架,在降低上下文使用率和错误记忆率的同时,提升了长期保留稳定性和多跳推理性能 。
|
| 2026-03-31 |
OBLIVION: Self-Adaptive Agentic Memory Control through Decay-Driven Activation |
|
|
• OBLIVION 引入了读/写解耦的记忆控制范式,将何时检索信息的决策与选择哪些信息进行强化分离开来。
• 该框架实现了由 L1 程序性记忆、L2 语义记忆和 L3 情节性记忆组成的层级记忆结构,并结合受艾宾浩斯启发的衰减驱动激活机制,在不进行显式删除的情况下管理记忆的可访问性。
• 在静态和动态基准测试上的实证评估表明,自适应记忆控制在长程交互中有效平衡了学习与遗忘,同时显著减少了干扰和计算开销。
|
| 2026-03-30 |
GEMS: Agent-Native Multimodal Generation with Memory and Skills |
|
|
• 提出GEMS,一个原生智能体多模态生成框架,通过结构化的多智能体循环和迭代优化来提升复杂指令下的生成质量 。
• 引入持久化智能体记忆机制,利用分层压缩技术管理历史上下文,并在多轮优化轨迹中提炼战略经验 。
• 开发可扩展的智能体技能模块,通过按需加载机制提供领域专业知识,有效应对专门的下游应用需求 。
|
| 2026-03-30 |
Understand and Accelerate Memory Processing Pipeline for Disaggregated LLM Inference |
|
|
• 统一了多种长上下文大语言模型推理优化方法,定义了一个通用的四步记忆处理流水线,并利用系统性性能分析将其识别为主要的性能瓶颈 。
• 该研究刻画了记忆处理流水线各阶段在定量与定性上的计算异构性,区分了计算密集型规则操作与访存受限型不规则任务 。
• 开发了一种 GPU-FPGA 异构系统,通过将不规则且访问受限的操作卸载到 FPGA,同时在 GPU 上保留计算密集型任务来加速推理,实现了显著的加速比和节能效果 。
|
| 2026-03-28 |
Codebase-Memory: Tree-Sitter-Based Knowledge Graphs for LLM Code Exploration via MCP |
|
|
• CODEBASE-MEMORY 提供了一种持久化的、基于 Tree-Sitter 的知识图谱架构,通过多阶段并行构建流水线和增量同步支持 66 种语言。
• 该系统引入了基于 MCP 的工具接口,公开了 14 种结构化查询工具(如调用路径追踪和影响分析),并具有亚毫秒级的查询延迟。
• 在 31 个仓库上的实证评估表明,与传统的文件探索智能体相比,该方法在实现竞争性回答质量的同时,将 Token 消耗降低了 10 倍,并将工具调用减少了 2.1 倍。
|
| 2026-03-27 |
Scaling Teams or Scaling Time? Memory Enabled Lifelong Learning in LLM Multi-Agent Systems |
|
|
• 提出了LLM多智能体系统的联合扩展视角,将团队规模扩展与终身学习扩展视为相互作用的扩展空间,而非孤立的轴线。
• 提出了LLMA-Mem终身记忆框架,通过整合情景记忆、程序记忆和交互记忆模块,在灵活的记忆拓扑下实现跨任务迁移与协作建模。
• 系统性实证研究揭示了非单调的扩展格局,证明有效的记忆设计能使小型团队在长程性能和标记效率上超越大型集体。
|
| 2026-03-27 |
MemBoost: A Memory-Boosted Framework for Cost-Aware LLM Inference |
|
|
• 提出 MemBoost,一个集成了关联记忆引擎、元控制器和大型语言模型 Oracle 的记忆增强型 LLM 推理框架,以优化成本与质量的权衡。
• 引入了“检索或升级”决策循环以及持续回写机制,实现了高效的语义答案复用和记忆增长。
• 通过在 MMLU-Pro 数据集上的实验证明,该框架在显著降低推理成本和延迟的同时,达到了与 Oracle 模型相当甚至更高的准确率。
|
| 2026-03-20 |
PersonaVLM — Long-Term Personalized Multimodal LLMs |
|
|
• 提出 PersonaVLM,这是一种创新的个性化多模态智能体框架,通过主动记忆管理与自演进的个性对齐机制,将通用多模态大语言模型(如 Qwen2.5-VL)转化为个性化助手.
• 实现了多类型记忆架构(核心记忆、语义记忆、情节记忆、程序记忆),以支持复杂的多轮推理,并具备主动记忆功能,可自动从多模态交互片段中提取并总结信息,构建持久化的个性化数据库.
• 引入基于动量的个性演进(PEM)机制以实现一致的响应生成,同时发布 Persona-MME 基准(涵盖 14 个细粒度任务,共 2,000 余个测试用例,CVPR 2026),并开源完整的模型权重、8 万余条训练样本及评估代码.
|
| 2026-03-19 |
MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution |
|
|
• 提出 MEMMA,一个即插即用的多智能体框架,通过前向和后向路径共同协调记忆循环,以解决记忆操作中的策略盲区和延迟反馈问题。
• 引入 Meta-Thinker 在记忆构建与迭代检索时提供显式策略推理,并设计了一种原位自进化记忆机制,将下游探针问答的失败直接转化为对记忆库的结构化修复操作。
|
| 2026-03-11 |
Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework |
|
|
• 大模型智能体的记忆系统正从静态检索转向动态自主更新,这虽然提升了智能体的适应性,但也引发了严峻的稳定与安全问题。其中包括语义漂移、固化错误工作流的程序漂移、外部恶意注入的记忆投毒。
• 提出稳定与安全治理记忆(SSGM)框架。该框架的核心设计理念是将智能体的“生成式认知策略”与“底层记忆存储介质”彻底解耦。它在两者之间引入了一个主动拦截的治理中间件,使记忆的更新不再是盲目的直接写入,而是必须经过多重网关的审查。
• 合并前验证,在写入前进行逻辑一致性检查,拒绝与核心事实相矛盾的更新,防止幻觉被固化
。时间与权限过滤,在读取时结合衰减函数过滤过期失效数据,并基于访问控制防止跨用户隐私泄露。可逆的定期对齐,采用“可变活动图+ 不可变情景日志”的双轨存储结构,系统会定期将当前记忆与不可变日志进行对齐与错误回滚,从而在数学上为长期的“语义漂移”设定了严格的误差上限。
|
| 2026-03-11 |
Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats |
|
|
• 文章针对OpenClaw等自主大语言模型智能体,系统性地分析了其在初始化、输入、推理、决策和执行五个生命周期阶段的安全威胁。
• 在OpenClaw上进行了详细的案例研究,证明了这些威胁的破坏力。例如,攻击者可以通过“记忆投毒”将瞬时的恶意输入转化为长期的行为控制;而在决策和执行阶段,模糊的指令可能引发“意图漂移”,使智能体将简单的安全检查任务升级为破坏性的系统防火墙修改和高危命令执行。
• 缓解策略包括:初始化阶段的插件验证与签名、输入阶段的语义防火墙隔离、推理阶段的动态记忆完整性校验与状态回滚、决策阶段的意图一致性验证,以及执行阶段的内核级沙箱与最小权限控制。
|
| 2026-03-12 |
Empowering Vision-Language-Action Model with
Memory via Dual-Level Recurrent Queries |
|
|
• ReMem-VLA 引入了两套可学习的循环记忆查询:帧级查询逐帧更新以捕捉短期记忆,而块级查询则在更长的时间跨度上更新,用于稳定维持长期记忆。
• 增加了一个视觉预测头,引入了过去观察预测作为辅助训练目标,强制模型通过重建历史 RGB 图像来召回视觉细节。针对变长序列循环训练的批处理难题,提出了一种基于槽的流式训练范式,能够在保证时间连续性的同时避免跨任务片段的状态泄露。
• 为了克服传统沿时间截断反向传播在长序列优化上的瓶颈,模型创造性地采用了冻结 VLM 加固定指数移动平均的无梯度循环更新路径,使得查询只需学习“提取什么任务相关信息”,而无需学习“如何传递”。
|
| 2026-03-11 |
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models |
|
|
• 现有的流式多模态大模型通常采用“感知与生成交替”的串行模式,这导致文本解码会阻塞视频的持续摄入,并且随着长视频的推进,模型极易遗忘早期的关键信息。为此,本文提出了一种“边看边思考”的全新流式推理框架。
• 该框架将视频划分为多个片段,并在系统运行中在线动态生成并维护持久的片段级记忆笔记,以隐式检索的方式支持多轮问答。
• 构建了专门的三阶段流式思维链(CoT)数据集(涵盖单轮适应、多轮交互和长程能力训练),并配合片段级的流式因果掩码(Causal mask)以保证严格的时间因果性。
|
| 2026-03-09 |
MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games |
<
|
|
• 多智能体长程博弈中早期错误易被放大,且固定提示词会导致策略僵化和评估结果方差极大的问题,本文提出了一种无需更新模型权重的自我对弈框架 MEMO。
• MEMO 巧妙地将“保留”与“探索”机制解耦并结合。它建立了一个持久化记忆库,利用 CRUD(增删改查)操作从对弈轨迹中提取结构化的策略洞察,并将其作为后续推理的先验知识注入;同时,它利用基于 TrueSkill 评分的锦标赛式提示词演化和优先经验回放机制,来高效探索策略并重访关键决策状态。
• 在五款文本博弈测试中,MEMO 展现了突出的学习效率,仅需 2000 局自我对弈,就能将 GPT-4o-mini 的平均胜率从 25.1% 提升至 49.5%,同时使运行结果的方差大幅下降。
|
| 2026-03-12 |
Collaborative Multi-Agent Optimization for Personalized Memory System |
|
|
• 现有的个性化大模型记忆系统通常由多个智能体组成,但过去的方法大多对它们进行独立的局部优化,忽视了跨智能体的协作,导致局部最优无法保证全局系统问答性能的最佳。
• 在为了解决异构智能体异步执行带来的优化难题,文章提出了 CoMAM 框架,将细粒度提取、粗粒度画像和记忆检索等智能体的执行流程建模为顺序的马尔可夫决策过程。
• 为了将局部的任务改进与全局系统性能对齐,CoMAM 通过计算每个智能体的局部奖励与全局系统奖励之间的组级排序一致性来量化其贡献。
|
| 2026-03-13 |
Structured Distillation for Personalized Agent Memory:11× Token Reduction with Retrieval Preservation |
|
|
• 提出将每次对话交互提取为结构化的复合对象,包含:核心内容、特定上下文、主题分类和涉及文件。这种方法遵循“保留核心词汇”原则,不随意改写专业术语,成功将每次交互的平均Token数从371压缩至38,实现了11倍的高效压缩。
• 在包含107种检索配置的测试中发现,最佳的纯蒸馏文本配置能够保留原始逐字文本96%向量搜索在11倍压缩下几乎没有出现显著的性能衰减。
• agent在上下文中仅携带压缩后的蒸馏文本作为“路由索引”进行高效检索,而原始的完整对话文本保存在本地,仅在用户需要深入查看时才调出显示。
|
| 2026-03-09 |
TA-Mem: Tool-Augmented Autonomous Memory Retrieval for LLM in Long-Term Conversational QA |
|
|
• 结构化的自适应记忆抽取:设计了一个记忆抽取智能体,能够通过单次交互根据语义相关性自适应地切分长上下文,并提取为包含摘要、关键词、事件等丰富信息的结构化记忆笔记。
• 工具驱动的自主记忆探索:构建了支持字符串键值匹配与向量相似度查询的多索引数据库。检索智能体可自主选择查询工具,在记忆空间中进行多轮迭代探索。
• 长程推理能力与Token效率双提升:通过灵活精准的工具调用及缓存机制过滤冗余上下文,该框架在复杂长程问题上显著超越基线,同时保持了较低的Token消耗。
|
| 2026-03-09 |
EVOKING USER MEMORY: PERSONALIZING LLM VIA RECOLLECTION-FAMILIARITY ADAPTIVE RETRIEVAL |
|
|
• 指出当前个性化大模型的记忆检索要么将历史记录全量输入导致上下文过载,要么仅依赖单次相似度检索而导致理解过浅。为此,研究团队借鉴人类记忆的“回想-熟悉度双过程理论”,提出了一种名为 RF-Mem 的自适应记忆检索框架。
• RF-Mem 会通过探测检索的平均相似度得分和熵值来衡量“熟悉度”。当熟悉度高且不确定性低时,系统采用快速的“熟悉度路径”,直接返回单次 top-K 结果;当熟悉度低且不确定性高时,则激活深度的“回想路径”。
• 在触发“回想路径”时,系统会对候选记忆进行聚类,并使用 α-mix 策略将聚类质心与原始查询进行混合更新。
|
| 2026-03-10 |
A Control-Theoretic Foundation for Agentic Systems |
|
|
• 提出了一种控制论框架,将AI智能体系统嵌入到反馈控制环中进行分析。该框架没有将AI的记忆、学习、工具调用、交互信号和目标表述视为孤立的零散功能,而是将它们统一整合到了一个单一的闭环动态架构中。
• 通过AI对控制架构所掌握的“决策权限”大小,创造性地定义了一个五级智能体层级结构。
• 将该框架应用于非线性和线性系统,文章指出随着智能体层级的提升,系统不可避免地会引入更多复杂的动态机制。
|
| 2026-03-11 |
When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows |
|
|
• 将智能体限制在隔离环境中,仅允许读写特定文件和调用预审的“医疗技能库”,从操作系统底层切断任意代码执行与网络访问,确保数据安全与合规。
• 摒弃传统的向量检索,将临床文档组织为带清单的树状结构。智能体依靠自然语言理解能力阅读清单,进行“渐进式披露”导航,从而精准、可解释地获取长期的病历上下文。
• 多智能体间不直接对话,而是通过“仅追加”写入共享临床文档及事件订阅来实现隐式协同。这使得智能体能进行临场任务编排,灵活应对传统系统无法处理的复杂、长尾临床需求。
|
| 2026-03-10 |
Trajectory-Informed Memory Generation for Self-Improving Agent Systems |
|
|
• 解决智能体的“失忆”问题,系统性地从其历史执行轨迹(包括完美成功、低效成功、失败及错误恢复)中自动提取可复用的实战经验。
• 提出一个完整的学习闭环,包含轨迹特征提取、决策归因分析、情境提示生成,以及上下文自适应检索。
• 在AppWorld基准测试中全面提升了智能体的任务表现,尤其在需要复杂规划的长序列任务上效果显著。
|
| 2026-03-09 |
AutoAgent: Evolving Cognition and Elastic Memory Orchestration for Adaptive Agents |
|
|
• 将智能体的认知结构化为“内部认知”和“外部认知”。这种认知作为智能体可更新的状态,会根据任务交互的实际结果不断进行自我修正和演进,从而为决策提供更准确、更少偏差的知识基础。
• 采用“选择-执行-更新”的动态循环进行问题求解。它将动作空间统一划分为“内部行动”和“外部行动”,使智能体能够完全根据当前上下文和实时认知来进行自适应的下一步规划。
• 为了解决长序列推理带来的上下文冗余与 Token 消耗问题,系统设计了弹性记忆编排器(EMO),用于动态压缩历史轨迹、过滤冗余信息并提取可复用的片段记忆。
|
| 2026-03-09 |
Multi-Agent Memory from a Computer Architecture Perspective: Visions and Challenges Ahead |
|
|
• 将多智能体记忆系统类比为经典的计算机系统,区分了共享记忆和分布式记忆两种基本架构原型。
• 提出了一种包含I/O层、缓存层和内存层缓存共享协议,以及用于规范读写权限与粒度的记忆访问控制协议。
• 未来构建多智能体系统最紧迫的挑战是解决记忆的一致性问题。这要求系统在多个智能体并发读写共享记忆时,能够妥善处理读取时的冲突、更新操作的可见性与顺序,并建立明确的版本控制与冲突解决规则,以保持全局上下文的连贯性。
|
| 2026-03-04 |
Adaptive Memory Admission Control for LLM Agents |
|
|
• 缺乏记忆准入控制会导致长程记忆库迅速被低质、冗余或无效的垃圾特征污染,拖垮多轮推理。
• 引入结构化自适应准入控制(A-MAC),通过轻量化提取未来效用、置信度、新颖度等五大可解释因子,对写入动作进行严格前置拦截。
• 确立了准入控制作为记忆设计的核心工程原则,从源头净化记忆库,在 LoCoMo 基准上实现了延迟与性能的双重优化。
|
| 2026-03-02 |
MemSifter: Offloading LLM Memory Retrieval via Outcome-Driven Proxy Reasoning |
|
|
• 大模型在执行长周期任务时,频繁调用主网络进行复杂记忆检索的成本极高,算力与准确性难以两全。
• 构建 MemSifter 框架,利用结果驱动的强化学习范式,将重度检索计算直接卸载给轻量级代理模型。
• 实现了检索架构的低成本解耦,极少推理开销即达到先进的检索命中率,是一种极具扩展性的工业级长程记忆解法。
|
| 2026-03-02 |
GAM-RAG: Gain-Adaptive Memory for Evolving Retrieval in Retrieval-Augmented Generation |
|
|
• 传统 RAG 系统采用静态索引结构,在面对高频复现查询时存在严重的遍历冗余与计算浪费。
• 受认知科学启发提出无训练 GAM-RAG 框架,利用卡尔曼滤波增益规则,基于查询反馈动态强化重复检索的记忆状态。
• 成功在索引稳定性与适应性间取得平衡,有效避免了无效检索,在保证准确率的同时大幅削减推理算力开销。
|
| 2026-03-02 |
Diagnosing Retrieval vs. Utilization Bottlenecks in LLM Agent Memory |
|
|
• 明确指出当前记忆系统的优化误区,需量化诊断写入、检索与利用三阶段各自对整体性能的真实影响。
• 设计诊断框架对主流写入与检索策略进行严格的交叉消融实验,剥离并解耦各阶段的贡献度。
• 证实检索阶段是压倒性的性能瓶颈(影响权重达 20%),且原始分块存储效能优越,指导业界将算力重仓于检索增强而非复杂压缩。
|
| 2026-02-28 |
MemPO: Self-Memory Policy Optimization for Long-Horizon Agents |
|
|
• 长程智能体被动依赖外部 RAG 检索,缺乏对历史信息有效性的自主判断与留存管理机制。
• 提出自记忆策略优化算法(MemPO),引入改进后的信用分配机制,赋予模型主动归纳和筛选高价值记忆的权限。
• 该算法通过精准剔除冗余信息,在显著压缩 Token 消耗的同时,实现了 F1 分数与任务性能的全面反超。
|
| 2026-02-26 |
ParamMem: Augmenting Language Agents with Parametric Reflective Memory |
|
|
• 推出 ParamMem 参数化记忆模块,通过多样化反思生成解决自我反思导致的输出重复问题。
• 采用温度控制采样和跨样本记忆技术,构建了高性能的 ParamAgent 框架。
• 在代码生成、数学推理等任务上显著优于现有基线,验证了反思多样性对任务成功率的正向贡献。
|
| 2026-02-26 |
Tell Me What To Learn: Generalizing Neural Memory to be Controllable in Natural Language |
|
|
• 创新性地提出一种可通过自然语言指令进行控制更新的通用神经记忆系统。
• 解决了传统模型无法让用户干预记忆内容的难题,支持代理从异构源中进行选择性学习。
• 该方法在医疗和客服等对记忆准确性和可控性有极高要求的场景中具有巨大应用潜力。
|
| 2026-02-26 |
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization |
|
|
• 提出 EMPO^2 混合策略优化框架,旨在破解 LLM 代理在强化学习训练中的探索瓶颈。
• 结合记忆引导探索与策略更新,确保代理在有无记忆场景下均具备极强的鲁棒性。
• 在 ScienceWorld 任务中实现 128.6% 的性能飞跃,且在分布外任务中表现出优异的适应性。
|
| 2026-02-26 |
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications |
|
|
• 推出专门针对自主代理环境交互(而非仅对话)的长程记忆评估框架 AMA-Bench。
• 同步提出 AMA-Agent 系统,利用因果图和工具增强检索来优化记忆检索质量。
• 研究揭示了现有内存系统在持续环境交互任务中的短板,并提供了有效的改进路径。
|
| 2026-02-25 |
Towards Autonomous Memory Agents |
|
|
• 提出自主记忆代理 U-Mem,将记忆模式从被动存储转变为主动获取、验证与策划知识。
• 引入成本意识的知识提取级联,从自我信号到专家反馈多级验证,结合语义感知的采样策略。
• 成功减轻了冷启动偏差,并在 HotpotQA 等高难度知识任务中超越了先前的记忆基线。
|
| 2026-02-25 |
Structurally Aligned Subtask-Level Memory for Software Engineering Agents |
|
|
• 针对软件工程代理在处理相似描述但逻辑相异任务时的痛点,提出结构对齐子任务级记忆。
• 该机制通过细粒度的任务切分与记忆对齐,显著增强了代理的长程推理能力。
• 在多个软件工程基准测试中证明了其在解决复杂逻辑纠缠任务时的优越性。
|
| 2026-02-24 |
ARCHITECTING AGENTOS: FROM TOKEN-LEVEL CONTEXT TO EMERGENT SYSTEM-LEVEL INTELLIGENCE |
|
|
• 该论文探讨了大型语言模型(LLMs)向动态自主认知系统转型的框架——AgentOS。
• 通过将LLM重新定义为“推理内核”,AgentOS引入了深度上下文管理的概念,以解决当前应用中长上下文任务的信息稀释和多代理协作的时间漂移问题。
• 论文详细阐述了AgentOS的核心组件,如认知同步脉冲(CSP)、语义切片理论与感知对齐机制,及其如何促进多智能体系统的集体智能涌现
|
| 2026-02-24 |
Pancake: Hierarchical Memory System for Multi-Agent LLM Serving |
|
|
• 提出多层次代理记忆系统 Pancake,解决大规模 LLM 服务中的多代理记忆碎片问题。
• 统一了多级索引缓存、协调索引管理及�
|