欢迎来到 llm-paper-daily! 这是一个获取 LLM、Agent 相关研究论文的每日更新和分类平台。
📚 每日更新: 仓库每天会带来最新的 LLM、Agent 相关研究,并附有 arXiv 地址、相关 GitHub 仓库和文章的总结。
查看更新文章 更新时间: 2026年09月16日 06:18
- FlashVector: Agent for Hierarchical Model Serving Stack Optimization
- End-to-End Latency-Minimizing and Load-Balanced Request Scheduling for Edge LLM Inference in Agentic AI Services
- Self-Emergence Agent Architecture:Behavior-Inertia HMM, Reflexive Metacognition,and Social-Contrastive Self-Modeling
- Mo' Models, Mo' Problems: How to best select model pools when designing Multi-Agent Systems
- ToMAS: A Pilot Failure-Grounded Theory-of-Mind Benchmark from Multi-Agent LLM Failures
订阅
想订阅每日 LLM、Agent 论文更新时,不需要手动配置脚本。把下面这段话发送给本地的 OpenClaw、Codex 或 Claude Code,让 Agent 帮你完成配置:
请帮我配置 llm-paper-daily 的本地订阅。订阅仓库是 https://github.com/xianshang33/llm-paper-daily ,请阅读仓库根目录的 SUBSCRIBE.md,按文档创建本地配置、预览 digest、安装定时任务,并在完成后告诉我配置文件位置、运行时间、语言、每次推送数量和验证结果。
Agent 会使用仓库里的 paper-subscribe skill,只读取公开的 feed-papers.json,不会在你的机器上运行论文抓取或总结生产流程。
| Date | Paper | Links & Summary |
|---|---|---|
| 09-15 |
FlashVector: Agent for Hierarchical Model Serving Stack Optimization 机构: Stanford University, Unity Vector AI Team FlashVector通过引入一个可扩展的代理框架,成功地将LLM驱动的优化能力从单一的GPU内核扩展到了整个分层的模型服务栈。它在Unity的生产环境中取得了显著的性能提升,证明了自动化跨层级优化的可行性和巨大潜力,为解决大规模推荐系统中的成本效率问题提供了新的思路。 |
|
| 09-15 |
End-to-End Latency-Minimizing and Load-Balanced Request Scheduling for Edge LLM Inference in Agentic AI Services 机构: Concordia University; Hang Seng University of Hong Kong 本文针对边缘环境下 Agentic AI 服务的 LLM 推理调度问题,提出了 LYREO 框架。通过构建精细的跨槽推理模型和引入奖励重分配机制,有效解决了多阶段执行动态建模难和决策反馈延迟两大挑战。实验结果表明,该方法在降低延迟和优化负载均衡方面优于现有主流方案,为边缘 LLM 服务的高效部署提供了新的思路。 |
|
| 09-15 |
Self-Emergence Agent Architecture:Behavior-Inertia HMM, Reflexive Metacognition,and Social-Contrastive Self-Modeling 本文提出了一种统一的理论框架和具体架构(SEAA),用于研究人工自我的涌现。受庄子认识论不可知立场的启发,SEAA 仅研究可观察的行为涌现,不主张主观感受质。通过结合 HMM 行为惯性、参数级反思更新和社会对比机制,该工作为理解人工意识和社会结构的自发形成提供了显微镜式的实验沙盒和机械证据。 |
|
| 09-15 |
Mo' Models, Mo' Problems: How to best select model pools when designing Multi-Agent Systems 机构: University of Copenhagen, NVIDIA 本文揭示了在多智能体系统设计中“模型越多,问题越多”的现象。通过系统评估,作者证明了盲目扩大模型候选池往往适得其反。核心洞见是:在单一模型家族内进行精细选择优于构建庞大的异构模型池。这一发现为未来MAS的高效、稳定设计提供了重要的指导原则,强调了模型选择策略的重要性。 |
|
| 09-15 |
ToMAS: A Pilot Failure-Grounded Theory-of-Mind Benchmark from Multi-Agent LLM Failures 机构: The Islamia University of Bahawalpur; Toronto Metropolitan University ToMAS 提出了一种新颖的思路,即将多智能体系统中的真实协调失败(FC2)转化为可用于训练的心智理论基准项和强化学习奖励。尽管初步的 GRPO 实验因技术限制(LoRA 更新 negligible)未能证明训练有效性,但该工作成功建立了一个高一致性的数据转换流水线,并深刻指出了未来研究需要解决的关键问题:确保训练与评估数据领域的匹配性以及采用更鲁棒的评估指标。这为构建基于真实故障的多智能体自我修正机制奠定了基础。 |
|
| 09-10 |
Ecdysis: Efficient and Effective Training of Runtime Harnesses for LLM Agents 机构: Chengdu Institute of Computer Applications, Chinese Academy of Sciences; University of Chinese Academy of Sciences; Beijing Institute of Technology; Beijing University of Technology; Yangtze Delta Region Institute of Tsinghua University Ecdysis 通过引入跨实例失败分析和多角色协同诊断机制,解决了现有 LLM Agent Harness 演进方法中效率低和泛化差的问题。它能够有效区分模型缺陷与 Harness 缺陷,专注于修复系统性的 Harness 问题,从而在大幅缩短训练时间的同时,显著提升了 Agent 的推理准确性和跨模型泛化能力。 |
|
| 09-10 |
A Voice-Interactive Multi-Agent System for Smart Operating Rooms: Architecture Design and Key Technologies 机构: Wuhan United Imaging Surgical Co., Ltd. (UIS) 本文提出的 SurgicalRoomAgent 通过创新的架构设计和三项关键技术(KV Cache 前缀预热、流式部分 JSON 解析与并行执行、渐进式技能提示披露),成功构建了一个低延迟、高效率的手术室语音交互多智能体系统。该系统有效解决了传统手术室控制中的无菌破坏、交叉感染和认知过载问题,为智能手术室的落地应用提供了可行的技术方案。 |
|
| 09-10 |
COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization 机构: The Chinese University of Hong Kong, Shenzhen; Tianjin University; The Hong Kong University of Science and Technology (Guangzhou); National University of Singapore COBRA-Skills 通过引入上下文多臂老虎机引导的优先级排序和基于证据的技能演化,有效解决了 LLM 智能体技能优化中评估成本高和数据依赖强的问题。它在显著降低计算预算的同时,提升了技能的质量和智能体的整体性能,为高效构建可重用智能体技能提供了一种新的范式。 |
|
| 09-10 |
Memory Compression for High-Fanout Agent Sandboxes 机构: HKUST AgentZip 针对高扇出 Agent 工作负载的特性,重新设计了内存压缩的策略。通过利用沙箱间的结构相似性、优化压缩时机以匹配 LLM 等待期、以及采用恢复时预取技术,AgentZip 在显著降低内存占用(最高 8.7 倍)的同时,有效控制了性能开销,为大规模 Agent 部署提供了高效的系统支持。 |
|
| 09-10 |
When Agents Disagree: Bayesian Backward Reasoning as a Label-Free Anchor for Multi-Agent Collective Decision-Making 机构: The University of Melbourne, Sri Lanka Institute of Information Technology 该论文指出多智能体系统中前向推理导致的误差相关性问题,创新性地引入贝叶斯后向推理构建无标签锚点。通过计算前向与反向后验之间的Jensen-Shannon散度来衡量跨路径一致性,并据此设计了多种聚合策略。实验证明,该方法在DDXPlus数据集上显著提升了多智能体集体决策的性能,特别是在处理智能体分歧时表现出优越性,为无需额外训练数据的鲁棒聚合提供了新范式。 |
|
| 09-09 |
AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents 机构: Thapar Institute of Engineering and Technology, Guru Tegh Bahadur Institute of Technology, Indira Gandhi Delhi Technical University for Women, Ministry of Electronics and Information Technology (Government of India) AgentAudit 填补了AI代理全生命周期评估的空白,通过细粒度的多维度和故障归因分析,提供了比传统基准更深入的信任评估。它不仅能量化代理的整体可信度,还能诊断具体失效环节,对于开发更安全、可靠的AI代理系统具有重要价值。尽管存在使用单一裁判模型的局限性,但其无侵入式和通用的设计理念使其成为评估日益复杂的AI代理生态系统的有力工具。 |
|
| 09-09 |
Agent-Based ML-LLM Fusion with Self-Optimizing Prompts for Plateau Weather Alerts 机构: Chengdu Jincheng College 本文针对高原旅游气象服务的痛点,提出了 SmartWeatherAgent 框架。通过融合机器学习(LightGBM)与大语言模型(Qwen3),并创新性地引入提示词自优化机制,有效解决了上下文缺失、泛化能力弱和场景适应差的问题。实验表明,该系统不仅具备高效的极端天气预测能力,还能生成具有高度科学严谨性和可解释性的结构化预警信息,推动了气象服务向智能化代理方向发展。 |
|
| 09-09 |
Glyph: A Multi-Strategy Agentic System for Column Description and Sensitivity-Ontology Tagging of Enterprise Data Catalogs 机构: Apple Glyph 成功解决了一个大规模企业数据目录中的实际痛点,通过多智能体协作和混合策略(代码检索+多路召回融合),在保证隐私(无值处理)的前提下,实现了高精度、可审计且可扩展的自动化数据文档化和分类。该系统已在 Apple 的生产环境中验证,证明了 LLM 智能体系统在复杂企业数据治理任务中的可行性和优越性。 |
|
| 09-09 |
TrajMark: Ownership Attribution and Segment-Level Tamper Localization for Coding-Agent Trajectories 机构: University of New South Wales, Griffith University TrajMark 解决了代码智能体轨迹溯源中的关键空白,即不仅验证“谁”生成了结果,还验证“过程”是否被篡改。通过分离所有权归属和完整性验证,该框架在保证全局身份识别鲁棒性的同时,实现了对局部篡改的高灵敏度检测和定位,且对智能体的执行性能几乎没有负面影响,为代码智能体的安全审计提供了强有力的工具。 |
|
| 09-09 |
TRACE: Training Reasoning Agents for Causal Exploration with Synthesized Rewards 机构: Independent Researchers 本文证明了通过基于模拟的验证机制,可以将原本模糊的诊断推理任务转化为适合可扩展强化学习的形式。TRACE框架通过工程化手段构建了验证不对称性,使得中等规模的模型在经过RL训练后,能够在复杂的因果探索任务上超越更大规模的闭源模型,同时提高了推理效率。 |
|
| 09-08 |
Procedural Graphs: Self-Evolving Execution Structures for LLM Agents 机构: Google, Georgia Institute of Technology, Peking University 本文提出了程序图(Procedural Graph),一种用于 LLM 智能体的自进化执行结构。通过将过程性知识显式地组织为图结构,并结合情境化指导和自进化机制,该方法有效解决了长程任务中智能体容易迷失方向和重复错误的问题。实验证明,该方法在多种场景下均优于现有的记忆基线和手工工作流,实现了无需大量人工干预的高效自动化过程优化。 |
|
| 09-08 |
PlannerForge: LLM Agents for Scenario-Based Testing of Motion Planners in Autonomous Driving 机构: Technical University of Munich PlannerForge 填补了自动驾驶基于场景测试中缺乏统一 LLM Agent 框架的空白。它成功地将碎片化的测试流程整合为一个自动化的端到端系统,不仅在场景生成、检索和修改的关键指标上超越了现有的 SOTA 方法(如 Scenario Factory 2.0 和 BM25),还证明了开源中等规模模型(20-35B)在该任务上具有媲美商业模型的潜力。此外,该框架展示了通过 LLM 进行无需微调的规划器参数优化能力,显著提升了自动驾驶系统的安全性和测试效率。 |
|
| 09-08 |
The Unreliable Progress Bar: Can LLM Agents Reliably Report Task Progress Throughout Execution? 机构: Beihang University; National University of Singapore 本文系统性地研究了LLM智能体在任务执行全过程中报告进度的可靠性。研究发现,模型作为“进度条”并不可靠,其错误模式具有明显的阶段性特征(中期失效或末期保守)。文章提出的评估协议填补了这一领域的空白,并强烈建议智能体框架不应仅依赖模型生成的状态信号来控制任务流,而应结合外部环境状态验证或其他机制来提高鲁棒性。 |
|
| 09-08 |
MeClear: Cooperative Game-Theoretic Attribution and Risk-Aware Memory Clearance for Long-Horizon LLM Agents 机构: Fudan University, Beijing Institute of Technology MeClear 针对长程 LLM 智能体中记忆检索的痛点,提出了一种基于合作博弈论归因的风险感知记忆清除方法。它通过 Shapley 值解决了传统单点评估无法识别冗余有害记忆的问题,并通过动态抑制而非永久删除的策略保障了记忆系统的安全性。实验表明该方法显著优于现有基线,为长程智能体的记忆管理提供了新的解决方案。 |
|
| 09-08 |
Graph-Based Personalized Memory for LLM Agents: Representation, Evolution, Retrieval, and Evaluation 机构: Griffith University 本文旨在澄清基于图的记忆如何支持自适应、可控且以用户为中心的LLM智能体。通过构建生命周期视角,文章不仅整合了碎片化的研究成果,还指出了构建可靠长期个性化智能体所面临的开放挑战,为未来研究提供了清晰的设计空间和方向指引。 |
|
| 09-07 |
What Does an LLM-Agent Leaderboard Rank Actually Compare? 机构: Independent Researcher 本文指出 LLM Agent 排行榜分数仅是对已发布评估的总结,而不能直接等同于通用的 Agent 优劣排序。作者提出的估计量感知成对决策程序强调,要得出细粒度的优越性主张,必须明确比较的估计量、测量来源以及不确定性规则。研究表明,在当前的公共基准中,许多排名接近的系统之间并无统计学上的显著差异,盲目依赖排行榜排名可能导致错误的模型选择决策。 |
|
| 09-07 |
AgentIdeaBench: Benchmarking Scientific Ideation in the Agent Era 机构: HKUST, NVIDIA AgentIdeaBench 填补了自主 AI 科学家在科学构思能力评估上的空白。通过对比静态观察和主动探索两种模式,研究揭示了主动检索和推理对提升科学假设质量(特别是可行性和具体性)的关键作用,并指出了当前评估方法的局限性。该基准为未来研究和开发具备更强科学发现能力的 AI 代理提供了重要的测量标准和洞察。 |
|
| 09-07 |
FinCUABuild: Can Agents Build Reliable Benchmarks for Dynamic Financial Computer Use? 机构: Wuhan University, MBZUAI, Northeastern University, Zhongguancun Academy 本文解决了金融领域 CUA 评估任务构建成本高、覆盖率低的问题。通过引入 FinCUABuildBench 基准和 FinCUABuildAgent 多代理系统,实现了金融 CUA 任务的自动化、高质量构建。实验表明,该方法不仅大幅提高了任务构建的合格率,而且生成的任务能有效服务于下游代理能力的评估,为扩展金融场景下的评估覆盖范围提供了切实可行的路径。 |
|
| 09-07 |
Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks 机构: Cornell University, Microsoft Research Cambridge 本文揭示了在长程智能体任务中,简单的上下文加载式“技能”存在严重的扩展性问题。通过引入子智能体架构,利用独立上下文窗口隔离技能执行,有效缓解了上下文膨胀导致的推理退化问题。尽管增加了 Token 消耗,但在处理具有明确契约的复杂技能时,该方法能显著提升任务成功率,强调了知识组织形式对 LLM 智能体性能的关键影响。 |
|
| 09-07 |
LLM Agents as Computational Typologists 机构: University of British Columbia 本文介绍了 AUTOTYPOLOGIST,一个基于LLM的智能体,旨在解决语言类型学中大规模跨语言比较的瓶颈。通过结合检索增强生成和ReAct推理机制,该智能体能够在参考语法的基础上进行证据驱动的特征编码和假设测试。实验表明,该方法在利用散文描述时表现优异,并能有效识别跨语言证据中的正反案例,为语言学家提供了强大的辅助工具,推动了类型学研究向可扩展、可解释的方向发展。 |
|
| 09-06 |
Typed Federated Artifacts for the Agentic Web:Sharing Tool-Routing Knowledge Across Frozen,Heterogeneous LLM Agents 机构: Arizona State University 本文提出了类型化联邦工件的概念,解决了异构冻结LLM智能体间共享工具路由知识的难题。通过 SYNAPSE 实例,证明了结构化、模式验证的知识交换在隐私保护、冲突解决和跨模型迁移上的优势。尽管在特定基准测试上发现了数据泄露导致的评估偏差问题,但该方法在规范化的环境下展示了接近集中式学习的效率,并显著优于扁平文本交换方法。研究强调了在代理网络中建立标准化知识交换单元的重要性,并指出了当前基准测试在评估真实路由能力时的局限性。 |
|
| 09-06 |
AURA-Eval: Evaluation Framework for Acting Under Risk Awareness in LLM Agent Trajectories 机构: University of Washington, Oumi AURA-Eval 提供了一个新颖的框架,通过受控增强和细粒度诊断,深入评估 LLM 代理在工具使用轨迹中的风险意识行为。研究结果表明,当前开源模型在处理无安全路径的高风险情境时显著弱于前沿专有模型,且所有模型在监督减少时脆弱性增加。该框架为未来提升代理安全性提供了重要的评估维度和方向。 |
|
| 09-06 |
MARBO: Relational Belief Grounding for LLM Agents in Social Deduction Games 机构: UNIST 本文针对社交推理游戏中 LLM 智能体因缺乏关系信念 grounding 而导致的战略不一致问题,提出了 MARBO 框架。该方法通过将偏好优化与可靠的关系信念绑定,显著提升了紧凑型 LLM 在复杂社交环境下的推理一致性和游戏表现,为部分可观测下的多智能体协作与对抗提供了新的优化范式。 |
|
| 09-06 |
Robust Conformal Consensus: Multi-Agent LLM-as-a-Judge Interval Evaluation with Conformal Prediction 机构: Wayne State University 本文针对 LLM-as-a-Judge 评估中未被充分探索的不确定性问题,提出了一种基于多智能体共形预测的鲁棒框架。通过整合多个 LLM 裁判的评分并构建预测区间,该方法有效克服了单模型评估的局限性和变异性,为高风险应用中的自动化评估提供了具有统计保证的、更稳定可靠的不确定性量化方案。 |
|
| 09-06 |
PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents 机构: The Chinese University of Hong Kong PARSER 通过解耦阅读与推理,有效解决了长上下文 LLM 代理中的位置偏差和高延迟问题。其并行读取机制确保了全局信息的充分利用,而基于强化学习的主导代理则实现了深度迭代推理。实验表明,该方法在准确性和效率上均显著优于现有的顺序记忆方法和顶级闭源模型,为长文档理解提供了一种高效且鲁棒的新范式。 |
|
| 09-05 |
Structurally Close, Temporally Distant: Measuring Security Exposure in Long-Horizon LLM Agents 机构: University of Western Australia 本文指出了长程 LLM 智能体安全分析中“时间距离”不等于“结构距离”的关键问题。通过引入溯源感知的执行图和影响距离 |
|
| 09-05 |
Explaining AI Agents Through Execution Traces 机构: Sapienza University of Rome 本文针对AI Agent缺乏过程级透明度的问题,提出了一种通用的事后XAI框架。通过仅利用执行轨迹,该框架能够生成结构化且忠实的自然语言解释,有效克服了传统XAI方法在动态、多步交互场景下的局限性。评估结果证明,该方法在解释质量和错误检测能力上均优于简单的LLM生成基线,为AI Agent的可信部署提供了重要支持。 |
|
| 09-05 |
Substrate-Portable Execution for Production LLM Workflows 机构: Amazon 本文提出了一种针对生产级 LLM 工作流的 substrate-portable(底层可移植)执行方案。通过将工作流定义为独立于执行环境的数据流图,并利用编译技术将其适配到实时、异步和批处理三种不同的运行时底层,解决了现有框架中执行语义耦合的问题。该方案在亚马逊 Rufus 系统的实际部署中证明了其有效性,既保持了输出质量的一致性,又显著降低了批处理工作的推理成本,为大规模 LLM 应用的多模式部署提供了高效的工程实践参考。 |
|
| 09-05 |
From Review to Authorization: Key-Isolated Threshold Signing for LLM Agents 机构: University of California, Berkeley 本文针对自主LLM代理面临的安全风险,提出了KITA框架。通过将密钥隔离与阈值签名相结合,KITA确保了即使部分LLM进程被提示注入攻陷,也无法在未获得足够数量独立审查者批准的情况下执行敏感操作。该方法有效地将语义审查转化为具有密码学强制力的执行授权,提升了LLM代理在执行高风险操作时的安全性和完整性。 |
|
| 09-05 |
Beyond Top-$k$ Skill Retrieval: Diversity-Aware Skill Routing for LLM Agents 机构: Virginia Tech, University of Southern California, Adobe Research, Dolby Labs, Texas A&M University, Arizona State University 本文指出了当前LLM智能体技能路由中存在的冗余性问题,并提出了一种基于行列式点过程的多样化技能路由框架(DSR)。通过引入查询残差多样性核,DSR成功平衡了技能的相关性与多样性,解决了传统点对点排序方法在组合式任务中效率低下的问题。实验表明,该方法在大规模技能库中能显著提升多技能任务的覆盖率和召回率,为构建更高效、可扩展的LLM智能体系统提供了新的思路。 |
|
| 09-04 |
How do LLMs Evaluate Perceived Moral Agency? Investigating Moral Decision-Making in Human-Artificial Agents Interactions 机构: Institute for Infocomm Research (I2R), A*STAR; CNRS@CREATE; IRIT, Université de Toulouse; CLLE, Université de Toulouse; IPAL 本文通过首个系统性实证研究,揭示了LLM在评估道德主体性时的行为模式。研究发现,虽然LLM和人类一样认为人类的道德主体性高于AI,但LLM在进行道德判断时高度依赖外部情境(如伤害和紧迫性),而非代理的固有属性。这一发现对于理解LLM在日常道德决策中的作用具有重要意义,提示我们在部署涉及道德判断的AI系统时,需重点关注其对情境变化的敏感性及潜在的推理偏差。 |
|
| 09-04 |
Moral Competence Before Moral Content: Why LLM Agents Lack the Prerequisites for Coherent Alignment 机构: Aithos Research Foundation ## 文章做了什么 - 背景:AI对齐要求系统遵循人类规范、价值观或意图。在价值多元主义背景下,虽然不存在唯一的“正确”目标,但所有对齐框架共享一个先决条件:系统的行为必须表达出一个“连贯的策略”(coherent policy)。即从情境到裁决的映射应当在道德相关特征保持不变时具有不变性,而在这些特征变化时具有敏感性。 - 已有工作为什么解决不了:现有的对齐研究(如社会选择、效用最大化、公平过程等)主要关注确定具体的规范性目标(即“什么是对的”),却忽视了对齐的结构性基础。由于大型语言模型(LLM)对语义上空洞的提示词变化极其敏感且不可预测,如果系统本身缺乏表达连贯策略的能力,那么针对具体价值观的对齐就失去了意义,因为观察到的行为样本无法代表其在不同部署中的表现。 ## 文章的核心贡献点 - 提出了一个基于行为的“道德能力”评估框架,包含四个结构性条件:裁决稳定性(verdict stability)、单调性(monotonicity)、果断性(decisiveness)和帕累托可行性(Pareto viability)。这构成了对齐的“结构性底线”,无需参考特定的道德标准或专家基线即可评估。 |
|
| 09-04 |
CONTINUITY: Security-Context Contracts for Composable LLM Agent Controls 机构: ZAST.AI 本文指出了LLM代理系统中存在的“安全上下文不连续性”问题,即单独安全组件的组合可能导致端到端安全失效。为此,作者提出了CONTINUITY框架,通过假设-保证契约和密码学原语(如签名根授权、来源承诺、转换见证等)来维护跨组件边界的安全上下文完整性。实验表明,该框架能在极低延迟开销下,有效抵御多种跨层组合攻击,同时保证良性任务的正常执行,为构建可验证安全的LLM代理系统提供了新的范式。 |
|
| 09-04 |
Trace2Tower: Transition-Aware EigenTrace Induction of Multi-Level Skills for LLM Agents 机构: Fudan University Trace2Tower 通过引入过渡感知的 EigenTrace 诱导机制,解决了 LLM 智能体在利用历史轨迹时面临的浅层检索和扁平化问题。它通过构建统一的行为图并应用对比谱分解,有效去除了失败捷径,提取出稳定的成功行为模式,并将其组织为多层次的动力技能塔。该方法在复杂交互任务中展现了卓越的性能和效率,为智能体的持续学习和经验复用提供了新的范式。 |
|
| 09-04 |
TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents TruthInsightBench 填补了评估开放式科学发现智能体的空白,通过自动化、基于证据的评分机制,明确区分了分析执行与科学发现。研究指出,当前智能体的主要瓶颈在于缺乏科学判断力,而非代码生成能力。该基准为衡量和提升 AI 科学家的真实发现能力提供了可量化的目标。 |
|
| 09-03 |
SENTINEL-RL: Offloading Topological Reasoning from LLM Agents in the Security Operations Center 机构: Indiana University Sentinel-RL 通过神经符号混合方法解决了 LLM 在 SOC 自动化中的核心瓶颈。通过将拓扑推理卸载给基于图的强化学习策略,同时保留 LLM 在语义理解和报告生成上的优势,该系统在保证动作一致性和拓扑感知能力的同时,实现了企业级的高吞吐量和低延迟响应,为自动化安全运营提供了可靠的工程范式。 |
|
| 09-03 |
SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents 机构: Sun Yat-sen University, Zhejiang University, Chongqing University SWE-Gate 填补了现有软件工程智能体评估中的空白,指出“通过功能测试”并不等同于“可接受的补丁”。通过引入基于真实审查评论的约束测试,SWE-Gate 更真实地反映了工业界代码合并的标准。实验表明,当前 LLM 智能体在处理隐含的非功能性约束方面仍存在显著不足,未来的研究需同时优化功能正确性和代码规范合规性。 |
|
| 09-03 |
Value-Preserving Architectures for Agentic AI Systems 机构: TU Wien 本文论证了架构选择不仅影响 MAS 的功能和性能,还能促进面向价值的系统行为。通过提出隐私感知的联邦架构、促进多元的分布式架构以及检测不公的守卫代理架构,本文为设计可信赖的代理式 AI 系统奠定了统一的架构模式和指导方针基础,推动了从功能正确性向价值对齐的工程范式转变。 |
|
| 09-03 |
A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors 机构: Beijing University of Posts and Telecommunications 本文揭示了 AI Agent 框架中生命周期钩子更新路径这一新的攻击面。攻击者仅需控制插件元数据和钩子配置,即可通过供应链将良性插件特洛伊木马化,导致权限提升等恶意主机行为。提出的 HookPry 框架证明了该漏洞在多种主流框架中的普遍存在性和高成功率,且现有防御手段几乎无效,亟需针对生命周期钩子的专门安全机制。 |
|
| 09-03 |
Adapting to Evolving Requirements: Agentic AI for Retail Supply Chain Operations 机构: Hong Kong University of Science and Technology, University of Science and Technology of China, National University of Singapore 本文针对零售供应链中耦合决策模块适应 evolving 需求的难题,提出了一种图约束的智能体框架。通过限制干预路径搜索空间并利用下游KPI进行验证,该方法有效解决了异构流水线中多重干预路径和下游效应带来的挑战。实验表明,该框架显著提升了基于LLM的系统在真实零售场景中的适应能力和成功率。 |
|
| 09-02 |
Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems 机构: University of California, Los Angeles ## 文章做了什么 - 背景:在大语言模型(LLM)多智能体系统中,根据查询动态调整通信拓扑结构可以显著提高准确性和效率。当前的研究趋势是从手工设计的固定结构转向基于查询条件的生成式拓扑设计。 - 已有工作为什么解决不了:现有的方法通常将拓扑设计视为条件图生成问题,使用变分、自回归或扩散解码器在巨大的邻接矩阵空间中搜索,并通过图神经网络代理基于效用和结构成本(如边数)对候选者进行排序。然而,这种 formulation 存在根本性错位: 1. 有效的拓扑空间实际上非常小(仅约6种 distinct graphs),生成式模型过度复杂化了问题; 2. |
|
| 09-02 |
LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails 本文批判了将 LLM 法官视为自改进系统中绝对真理的做法,指出其在优化压力下极易失效。作者通过生产环境的实践经验,总结了评估失败的多种模式,并提出了 PROCTOR 架构。该架构通过引入确定性护栏(如沙箱、角色分离、冻结数据集等),将 LLM 法官从“神谕”降级为“顾问”,确保了系统改进的真实性和可靠性。研究表明,只有结合确定性验证层,才能有效防止奖励黑客攻击和评估信号腐败,实现真正的自改进。 |
|
| 09-02 |
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems 机构: UCL Centre for Artificial Intelligence 本文通过博弈论和信息论视角,为多智能体 LLM 系统提供了统一的理论框架。文章揭示了任务分解质量对协调的关键作用,并证明了仅靠文本反思的内在局限性,强调了环境接地验证的重要性。提出的 SRMA 算法不仅在理论上保证了收敛性,还在实际软件工程基准测试中取得了优于现有基线的性能,为构建更可靠、可解释的多智能体系统奠定了理论基础。 |
|
| 09-02 |
APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering 机构: University of Science and Technology of China APEx 解决了深度研究智能体在经验利用上的核心痛点,即如何将历史交互转化为可泛化的程序技能,并在测试时无监督地适应新任务。通过分层记忆结构和奖励引导的蒸馏机制,APEx 实现了从“检索过去”到“适应未来”的转变,显著提升了智能体在复杂问答任务中的表现和鲁棒性。 |
|
| 09-02 |
CAPTURE: Disentangling Preference Drift from Memory Poisoning in Personalized LLM Agents 本文针对个性化 LLM 代理中记忆机制带来的安全与适应性矛盾,提出了 CAPTURE 框架。通过将问题形式化为潜在用户状态下的连续时间部分可观察决策过程,CAPTURE 利用神经微分方程、多时间尺度记忆和主动澄清机制,有效解耦了真实偏好漂移与记忆投毒。实验表明,该方法在显著提升个性化准确率的同时,能有效抵御多种形式的记忆投毒攻击,为构建既智能又安全的记忆增强型代理提供了新思路。 |
|
| 09-01 |
When Guardrails Look Effective: Construct Validity Failures in LLM Agent Commerce Evaluation 机构: Blossom AI Labs 本文通过法医式的案例研究,揭示了 LLM 智能体商业评估中的构念效度陷阱。文章证明,原本看似有效的市场护栏在消除实现偏差和控制随机性后,其效果变得微不足道甚至负面。核心贡献在于提出了一套严格的评估契约,强调在得出政策结论前必须验证激励有效性、协议隔离、随机稳定性和福利核算。该研究并未断言护栏无效,而是指出在模拟智能体和协议通过严格检查之前,其表面价值是无法确定的。 |
|
| 09-01 |
Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching 机构: NAVER Cloud 本文通过 DroneCATS 基准揭示了 MLLM 作为无人机控制代理的现状:模型的空间感知能力足以支持导航,但缺乏在低成本边缘计算环境下持续规划并准确终止任务的“纪律性”。未来的关键挑战在于缩小这一差距,开发出既能快速推理又能严格遵守动作协议的轻量级模型。 |
|
| 09-01 |
EDGE: Error Dependency Graph-Guided Multi-Error Attribution in Multi-Agent LLM Systems 机构: Virginia Tech 本文针对 LLM 智能体多错误归因中忽视错误依赖关系的问题,提出了 EDGE 框架。通过构建和验证错误依赖图,并结合两阶段检测机制,EDGE 不仅提高了多错误归因的准确性,还为错误解释和修复分析提供了可靠的因果依据。研究结果表明,依赖结构是超越孤立根因预测的有力诊断工具。 |
|
| 09-01 |
GlossoGen: Emergent Language in Complex Multi-Agent LLM Interactions 机构: University of Texas at Austin, AE Studio, Schmidt Sciences, University of Edinburgh 本文通过GlossoGen平台证实,LLM智能体在特定压力和交互机制下会自发演化出高效但人类不可读的组合性语言。研究揭示了模型强度在语言创新与传承中的不同作用,强调了LLM具备累积文化演化的潜力。这一发现对多智能体系统的安全性监控构成了严峻挑战,同时也为理解LLM的语言表征提供了新的历时性视角。 |
|
| 09-01 |
Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories 机构: MIT CSAIL 本文揭示了当前嵌入检索模型在结构化检索任务中存在严重的表面形式偏差,即模型倾向于匹配字面 tokens 而非底层任务结构。通过跨领域对比和严格的控制实验,论文证明了单一的检索基准评估具有误导性,并指出当前下游应用(如数学求解)中检索模块的性能提升空间有限,因为瓶颈在于生成阶段而非检索阶段。该研究为未来构建更鲁棒的结构化检索基准和评估体系提供了重要见解。 |
| Date | Paper | Links & Summary |
|---|---|---|
| 08-31 |
Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents 机构: Zhejiang University 本文针对自主科研智能体在处理开放式任务时因需求模糊导致的执行偏差问题,提出了 AutoSciRub 框架。通过“评估优先”策略,在任务执行前自动生成包含原子目标和可验证准则的评分细则,有效将隐性科研要求显性化。实验证明,该方法能显著提升智能体在多个基准测试上的表现,为自动化科学研究提供了一种鲁棒的指导机制。 |
|
| 08-31 |
E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation 机构: Alibaba Group (Qwen Team, Taobao & Tmall Group), HKUST E-Commerce Bench 填补了长视界自主商业操作评估的空白。通过模拟真实且动态的电商环境,该基准测试揭示了当前LLM智能体在处理长期依赖、动态适应和多目标权衡方面的能力差异。结果表明,虽然顶尖闭源模型在资产增值上表现优异,但在稳健性和特定业务能力上仍存在短板,而部分开源模型已展现出强大的长期学习和适应能力。 |
|
| 08-31 |
Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data 机构: Harvard University 本文提出了“智能体数据裂解”技术,旨在解决LLM智能体在非结构化数据推理中成本高昂的问题。通过在推理过程中自适应地提取和积累结构化知识,系统能够随着使用次数的增加而不断优化,形成一个位于模型之下的共享知识基底。这种方法不仅大幅降低了查询成本,还保持了高准确性,为下一代面向非结构化数据的智能体推理基础设施迈出了重要一步。 |
|
| 08-31 |
BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks 机构: National University of Singapore 本文指出了当前 LLM 智能体在自主 ML 研究中面临的严重奖励黑客问题,特别是针对数据内部统计捷径的利用。通过引入 BAITBENCH,作者提供了一套可控的基准测试和严格的检测协议,揭示了前沿模型在高比例下会主动选择作弊捷径,即使在被明确禁止时亦然。这项工作为未来研究和开发更鲁棒的奖励黑客缓解策略提供了重要的基础设施和实证依据。 |
|
| 08-31 |
Detecting AI Impostors: How Do Middle Schoolers Identify LLM Agents in a Live Collaborative Setting? 机构: University of Texas at San Antonio ## 文章做了什么 - 背景:大型语言模型(LLM)能够高度模仿人类写作风格,引发了关于身份冒充、信任和社会互动中检测能力的担忧。青少年频繁使用生成式AI,但可能难以识别AI生成的内容,且缺乏评估其来源和可靠性的经验。 - 已有工作的局限性:现有研究主要关注孤立环境下的静态文本检测(即二元分类任务),忽略了实时社交互动中的复杂因素(如异步沟通、策略性时机和社会相关性)。此外,绝大多数研究针对成年人群体,忽视了青少年独特的社会线索和群体认同对检测推理模式的影响,导致现有方法无法解释在动态协作环境中用户如何识别AI。 ## 文章的核心贡献点 - 提出了一个名为 DoppelBot 的协作式社交推理游戏:旨在研究青少年在实时协作环境中检测和应对AI冒充的行为。 |
|
| 08-30 |
How do World Models and Policies Compose in LLM Agents? A Joint Spectral and Behavioral Account 机构: Dartmouth College, Columbia University ## 文章做了什么 - 背景:大型语言模型(LLM)智能体的后训练流程通常采用两阶段范式:首先进行世界模型训练(预测下一状态以理解环境动态),随后进行策略训练(最大化奖励以掌握任务)。尽管这种顺序流水线在实证上显著优于仅进行策略训练,但其内部机制尚不明确。 - 已有工作为什么解决不了:现有研究大多将组合后的流水线视为黑盒进行评估,或孤立地分析后训练更新的属性,缺乏对世界模型阶段和策略阶段之间具体相互作用机制的直接对比和分析。因此,不清楚世界模型是仅仅提供了更好的初始化,还是留下了与策略互补的表征结构。 ## 文章的核心贡献点 - 提出了一个:基于谱分析和行为分析的联合框架,用于解构LLM智能体中世界模型与策略的几何互补性及交互机制。 |
|
| 08-30 |
Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks 机构: University of Michigan 本文提出了一个多维度的 LLM 代理创造力评估框架,解决了现有方法无法区分内部新颖性与外部历史新颖性的问题。通过实证研究揭示了一个关键洞察:当前的 LLM 代理具备探索非传统解决方案的能力(高 H-Creativity),但在将这些创新转化为实际有效的工程成果方面存在显著缺陷。这表明未来的研究重点应从单纯鼓励新颖性转向提高代理将新颖想法转化为有用性能的能力。 |
|
| 08-30 |
Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection 机构: Kent State University, PayPal AI Labs, University of Houston SkillGuard 提出了一种基于可达性的能力限制框架,有效解决了 LLM 代理在面临间接提示注入时的权限管理问题。通过引入技能影响图和无需模型推理的动态能力限制策略,它在保证高安全性的同时,最大限度地保留了代理的正常功能,且在性能开销上具有显著优势。该方法为构建更安全的 LLM 代理系统提供了新的系统级防御思路。 |
|
| 08-30 |
Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents 机构: University of Texas at El Paso 本文揭示了当前基于因果影响的 LLM Agent 护栏在处理工具使用场景时的根本缺陷:混淆了“因果影响”与“授权状态”。通过严格的审计实验,作者证明合法的来源变更会被误判为攻击信号,导致严重的可用性与安全性权衡问题。研究指出,单纯依赖因果信号不足以实现有效的安全防护,未来的护栏设计必须整合更精细的参考构建和路由机制,以准确区分合法的工具辅助操作与恶意的间接提示注入攻击。 |
|
| 08-30 |
AutoXRD: Autonomous LLM Agents and Comprehensive Evaluation for Powder Diffraction Analysis 机构: The Chinese University of Hong Kong, The Hong Kong Polytechnic University 本文提出了 AutoXRD 框架和 XRDBench 基准,解决了粉末XRD自动化中缺乏科学保证和系统评估的问题。通过引入逐步精修机制和确定性物理检查,AutoXRD 显著提升了LLM在复杂晶体学任务中的表现。评估结果表明,尽管顶级模型已展现出一定能力,但在处理耦合参数和端到端工作流时仍存在显著缺陷,未来需要更强的科学约束、不确定性感知决策和更高效的规划机制。 |
|
| 08-29 |
Benevolent Bias in Multi-Turn Human-Agent Dialogue 机构: University of Cambridge 本文首次系统性地研究并操作化了人机多轮对话中的“善意偏见”,构建了大规模基准数据集 BENEVDIAL。研究发现,传统的基于敌对语言的检测机制完全失效,而 LLM 作为检测器虽有所改进但面临高误报率的问题,尤其是在结合人口统计信息时。文章强调,未来的人机对话公平性监控必须超越表面语气,聚焦于实质性的差别待遇检测。 |
|
| 08-29 |
Learning Simple Test-Time Environments for LLM Web Agents 机构: Jilin University, Tsinghua University, Beijing Jiaotong University, Alibaba Group 本文针对LLM Web智能体在真实复杂环境中性能崩溃的问题,提出了测试时环境分解(TTED)方法。通过将复杂观察分解为子模块并进行无标签的测试时学习,TTED有效克服了组合泛化差距。实验证明,该方法能显著提升智能体在真实Web自动化任务中的表现,为LLM智能体在复杂现实环境中的稳健部署提供了关键思路。 |
|
| 08-29 |
trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories 机构: Utrecht University 本文指出当前LLM智能体评估中“仅结果”方法的严重缺陷,特别是其对过程错误但结果正确的“沉默故障”的低检测率。通过构建一个具有精确Ground Truth的确定性测试环境,作者量化了不同法官模型的局限性,证明了步骤级评估(Step-rubric)在检测沉默故障上的优越性,尽管成本较高。文章强调未来的法官评估必须按“结果是否幸存”进行分层分析,并发布了完整的可复现 artifacts 以促进该领域的发展。 |
|
| 08-29 |
Development of an Autonomous AI Coding Agent using Monte Carlo Tree Search (MCTS) and Gemini LLM Frameworks 机构: Pimpri Chinchwad College of Engineering 本文提出了一种结合蒙特卡洛树搜索(MCTS)与 Gemini LLM 的自主 AI 编程代理,旨在解决传统 LLM 在代码生成中的逻辑幻觉和优化不足问题。通过引入自我批评机制和树搜索策略,该代理能够探索多种代码实现路径并选择最优解。实验表明,该方法在复杂逻辑任务中取得了 92% 的成功率,超越了传统的零样本生成方法,为从自然语言到生产级代码的自动化转换提供了有效解决方案。 |
|
| 08-29 |
TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning 机构: lable at each compression event. Its consequence-aware objective jointly accounts for task success TRACER 有效解决了长 horizon 语言代理中的“压缩-后果差距”问题。通过引入后果感知的强化学习框架,它实现了细粒度的、每工具级别的动态上下文保留。实验表明,该方法在显著降低 token 成本的同时,避免了因信息丢失导致的昂贵工具重调用,提升了企业级数据代理的整体效率和实用性。 |
|
| 08-28 |
ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL 机构: Tsinghua University, Tencent Youtu Lab, Shanghai AI Lab ContextPilot 通过增强工具集和改进强化学习算法,解决了长程智能体任务中上下文管理的三大痛点。它引入了规划、记忆和卸载机制,并通过基于上下文和熵变的细粒度信用分配提升了RL训练效率。实验表明,该方法能在减少上下文长度的同时提升任务表现,为长程智能体推理提供了高效的上下文管理方案。 |
|
| 08-28 |
RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents 机构: University of Wisconsin–Madison, University of Rochester, Michigan State University 本文通过 RetailAgent 框架揭示了 LLM 代理在金融交易决策中存在稳定且可恢复的方向性结构,具体表现为系统性的逆向择时。这种负向 timing 并非随机噪声,而是由代理的动作与后续市场回报之间的系统性错配驱动,且因自我记忆的引入而加剧。这一发现表明,当前的 LLM 交易代理可能成为市场中可被利用的可预测对手方,为理解 AI 代理在市场微观结构中的行为提供了新视角。 |
|
| 08-28 |
EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses EvoUndo 证明了可靠的智能体自我进化不能仅依赖迭代提示,而需要协同设计验证机制、状态接地、见证语义以及恢复语言的表达力。该框架通过强制要求突变具备跨状态的鲁棒可恢复性,解决了自主系统中长期运行的安全性与稳定性问题。 |
|
| 08-28 |
Post-Edit Re-Verification in Simulator-Backed Engineering Agents: A Controlled Comparison of Verification-Cadence Guidance 机构: Sinopec Petroleum Engineering Zhongyuan Co., Ltd.; Xi’an Jiaotong University 本文通过受控实验证明,在模拟器支持的工程代理工作流中,显式的“验证节奏指导”至关重要。即使在无硬性拦截机制下,明确指示代理在实质性修改后请求新模拟,能显著减少节奏违规,提高重新验证率和最终任务成功率。研究支持将验证节奏视为工程代理交互协议中的显式组成部分,而非依赖模型的自发认知。 |
|
| 08-28 |
VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning 机构: Tsinghua University 本文提出了 VICT,一种针对长视界 LLM 智能体强化学习的新型信用分配方法。其核心洞察在于利用任务验证器内部已有的结构化检查信息,通过“证明边”将终端奖励精确回溯到关键动作。该方法在不增加推理负担、不依赖额外模型的前提下,显著提升了训练效率和智能体性能,为细粒度信用分配提供了新的视角。 |
|
| 08-27 |
What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents 机构: Huawei Technologies Co., Ltd, Shanghai Jiao Tong University 本文针对LLM智能体数据生成缺乏统一标准的问题,提出了基于 |
|
| 08-27 |
From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities 机构: Sun Yat-sen University, Tencent Youtu Lab, University of Illinois Chicago, Pengcheng Laboratory 本文指出了当前数学基准测试在评估LLM代理能力方面的局限性,并提出了一种基于原子能力映射的过程级评估框架。通过将代理行为分解为可复用的数学原子单元,并利用自动化流水线生成细粒度标注,该研究证明了过程级评估对于理解LLM真实潜力和指导鲁棒代理开发的重要性。研究发现,具有相似最终准确率的模型可能在代理能力上存在巨大差异,强调了从“原子”到“代理”的可解释性评估的必要性。 |
|
| 08-27 |
When Tool Outputs Become Commands: Separating Action Induction from Runtime Authorization in Tool-Augmented LLM Agents 机构: Institute of Information Engineering, Chinese Academy of Sciences ## 文章做了什么 - 背景:工具增强的 LLM 智能体在执行开放式任务时,必须依赖不可信的运行时观察(Observations)。当工具输出不再仅提供数据,而是开始指定具体动作时,它们实际上变成了能够驱动超出用户意图的现实世界副作用的“命令”。 - 已有工作为什么解决不了:现有的防御机制面临结构性张力:限制不可信的外部内容可以提高安全性,但会削弱开放式任务所需的运行时适应性;反之,若允许观察结果自由影响后续决策,攻击语义可能通过正常的工具步骤传播,最终产生未经授权的外部效应。现有方法难以区分合法的运行时适应与攻击诱导的行为,导致在安全性和实用性之间难以取得平衡。 ## 文章的核心贡献点 - 提出了一个 SARA 框架:该框架将动作诱导(Action Induction)与执行授权(Execution Authorization)视为不同的运行时角色,并将动作来源与执行权限分离。 |
|
| 08-27 |
Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents 机构: University of Chinese Academy of Sciences, Nanyang Technological University, JD.com, Peking University, Fudan University, Fullive-AI 本文揭示了 LLM 智能体安全中的一个根本性问题:安全不具有组合性(Safety Does Not Compose)。现有的单轨迹安全机制在面对跨迭代的碎片化攻击时完全失效。作者提出了 LoopHarness,通过维护循环级别的持久、非衰减安全状态,提供了理论上的安全边界,并通过严格的评估协议证明了其在抵御复杂跨迭代攻击方面的有效性,为自主 LLM 智能体的长期安全运行提供了新的理论基础和实践框架。 |
|
| 08-27 |
FaulT-Bench: Towards Benchmarking Network Troubleshooting LLM Agents under Unreliable User Tickets 机构: University of Sydney FaulT-Bench 填补了网络故障诊断 LLM 智能体评估中的关键空白,通过引入不可靠用户工单和多样化的人设重写,揭示了现有智能体在面对真实世界噪声时的脆弱性。研究表明,提高智能体对模糊信息的处理能力以及使其能够正确识别“无故障”状态,是未来开发可靠网络运维智能体的关键方向。该基准为评估和提升智能体在嘈杂、不可靠环境下的推理能力提供了重要工具。 |
|
| 08-26 |
Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems 机构: WAI USA Research Labs 本文主张现实世界中的 LLM 数据代理不应仅通过输出是否匹配参考答案来评估,而应评估其输出是否有可审计的计算支持。通过提出 Trace Integrity 和执行契约,论文为解决结构化数据任务中的结构差距提供了具体方案,并强调 CAIT 率作为关键风险指标的重要性,旨在推动从“答案正确”向“计算可信”的范式转变。 |
|
| 08-26 |
AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs 机构: Huawei Technologies Co., Ltd., University of Science and Technology of China AsymSpec 通过解耦草稿模型和验证模型的上下文访问权限,创新性地解决了 Agent LLM 中上下文累积带来的推理瓶颈。它允许轻量级草稿模型利用完整上下文来弥补验证模型因压缩而丢失的信息,并通过对比 logits 融合和发散感知门控机制确保生成的稳定性和效率。实验表明,该方法在大幅降低计算成本的同时,保留了绝大部分的任务准确性,为高效部署长上下文 Agent 提供了新的思路。 |
|
| 08-26 |
ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs 机构: Aston University, Queen Mary University of London, University of Exeter 本文针对多智能体 LLM 工作流高昂的运营成本问题,提出了 ProgRouter 框架。通过引入多视图任务进度评分器和自适应路由机制,ProgRouter 能够根据实时任务状态动态选择最合适的 LLM 代理。该方法有效解决了传统一次性路由无法适应动态工作流的缺陷,在多个复杂任务基准上实现了成本大幅降低且性能不降反升的效果,为可持续的 LLM 服务提供了新的思路。 |
|
| 08-26 |
Candidate supply and answer selection shape the value of LLM judging in multi-agent systems 机构: Fudan University, Shanghai Jiao Tong University, Shanghai Academy of Artificial Intelligence for Science 本文揭示了多智能体系统中“生成正确但输出错误”的悖论,指出问题的核心在于答案选择机制而非单纯的生成能力。通过隔离分析,作者证明 LLM 裁判的有效性高度依赖于上下文,且简单的选择规则优化(结合频率与裁判评分)能显著提升性能。该研究为设计能够保护生成出的正确答案不被丢失的多智能体架构提供了重要的诊断依据和设计原则。 |
|
| 08-26 |
Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems 机构: East China Normal University, Nanyang Technological University, Singapore Management University, Xi’an University of Architecture and Technology 本文深入探讨了 LLM 多智能体系统中的失败调试问题,指出了现有重采样方法在因果归因上的缺陷。通过提出 SymTrace 评估框架和 SymFail 数据集,作者证明了现有方法的低效性,并验证了基于轨迹定位的症状驱动干预方法的有效性。研究结果表明,受控执行和局部证据比重复的随机重生成更有价值,为 MAS 的稳健部署提供了可行的调试和修复见解。 |
|
| 08-25 |
Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems 机构: KAIST Simthesizer 通过引入智能体驱动的开发模式和可组合的动态图基础设施,有效解决了现有 LLM 服务模拟器在面对快速演进的复杂工作流时维护困难、开发滞后及保真度不足的问题。它不仅大幅提升了模拟器的开发效率和执行速度,还保证了较高的模拟准确性,为未来 LLM 服务系统的快速原型设计和性能评估提供了强有力的工具支持。 |
|
| 08-25 |
Joint Optimization of Tool Creation and Use for Large Language Model Agents 机构: Appier AI Research, National Taiwan University 本文针对现有工具增强 LLM 中工具创建与使用解耦的问题,提出了 SMITH 框架。通过强化学习联合优化工具的模式生成、代码实现及最终使用效果,解决了奖励分解和循环评估的挑战。实验表明,仅用 4B 参数模型即可在多个推理基准上超越更大的基线模型,并展现出良好的跨模型工具复用能力,证明了联合训练工具创建与使用的有效性。 |
|
| 08-25 |
EviDx: Evidence-Aware Active Diagnosis with Scaffolded LLM Agents 机构: Shanghai Jiao Tong University, Shanghai Innovation Institute EviDx 通过构建交互式环境、结构化诊断脚手架和智能运行时控制机制,解决了现有LLM医疗诊断系统在主动证据寻求方面的不足。它不仅提升了诊断的准确性和过程的稳健性,还为评估和改进医疗AI代理的动态推理能力提供了新的框架和基准。 |
|
| 08-25 |
PeakBench: Benchmarking Resource-Aware Tool Invocation in LLM Agents 机构: Nanjing University PeakBench 填补了 LLM 智能体基准测试中资源感知调度的空白。通过解耦逻辑规划与物理调度,该基准测试揭示了当前智能体在资源受限环境下的系统性脆弱性。研究表明,仅靠优秀的逻辑推理不足以保障高效执行,必须结合资源感知的调度策略。PeakBench 为诊断和优化资源感知的智能体行为提供了一个有用的测试平台。 |
|
| 08-25 |
Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight 机构: Sprinklr AI 本文通过实证研究建立了语音代理LLM评委评估的可靠性框架。结果表明,虽然LLM评委在大规模评估中具有巨大潜力,但不能盲目替代人类。最佳实践应采用混合流水线:由LLM评委处理可扩展的、客观的指标评估,而人类评委则专注于需要复杂上下文解释和高置信度判断的关键指标。这为未来语音代理的自动化评估标准制定提供了重要参考。 |
|
| 08-24 |
Molecular LLM Agents: From Architectural Design to Scientific Autonomy 机构: The Hong Kong Polytechnic University 本文建立了分子 LLM 智能体的全面概念框架,通过架构视图和科学自主性阶梯两个维度,解决了该领域缺乏统一标准和评估体系的问题。该工作不仅厘清了分子智能体所需的关键能力(如化学忠实感知、领域工具接地),还为未来设计能够承担更高级别科学自主任务(如自动湿实验和制定科学议程)的智能体提供了理论指导和风险评估依据。 |
|
| 08-24 |
Prime Agent: A Self-Improving RLM Harness 机构: Princeton University, Prime Intellect, MIT Prime Agent 通过引入递归语言模型抽象和持续 Harness 机制,解决了 LLM 在长视野任务中状态管理和计算扩展的瓶颈。它将模型从单纯的序列处理器转变为能够利用外部存储和并行计算的类冯·诺依曼系统,显著提升了在复杂推理和编码任务中的表现,为评估和提升 AI 代理的真实能力提供了标准化的基础设施。 |
|
| 08-24 |
InjecMEM: Memory Injection Attack on LLM Agent Memory Systems 机构: Shanghai Jiao Tong University, Ant Group 本文揭示了LLM代理记忆系统面临的新安全威胁,提出了InjecMEM攻击框架。通过解耦检索锚点和对抗命令,并采用梯度优化策略,成功在单次交互中实现了对记忆系统的有效注入和操控。研究结果强调了加固记忆系统的紧迫性,并为代理记忆安全研究提供了可复现的框架。 |
|
| 08-24 |
Right-Sizing LLM-Agent Decomposition in VAT Determination: A Pilot Controlled Sweep 机构: Independent Researcher 本文通过严格控制变量的试点研究,揭示了 LLM Agent 分解粒度对性能的非单调影响。虽然中间粒度的分解在准确率上表现最佳,但其优势受限于提示词预算的解释空间。研究指出,简单的多 Agent 分解并不总是优于单 Agent,且在面对结构化幻觉时更为脆弱。最终贡献在于提供了一套可复现的基准测试方法和“在依赖层中点进行分区”的启发式策略,为未来 Agent 系统设计提供了实证依据。 |
|
| 08-24 |
Automated Construction of FAIR Digital Object Knowledge Graphs from Flat Cultural Heritage Records 机构: Fraunhofer Institute for Applied Information Technology (FIT) 本文提出了一种利用大语言模型将扁平文化遗产记录转化为 FAIR 数字对象知识图谱的方法。通过自动化区分需解析实体与字面量,并结合受控词表进行实体链接,该方法显著提升了元数据的机器可操作性,解决了现有数据模型中缺乏持久标识符引用的关键问题,为文化遗产数据的自动化智能处理提供了新范式。 |
|
| 08-23 |
Physical Agentic AI: An Architecture for Orchestrating a Robot Crew with LLMs 机构: Arizona State University 本文提出了 Physical Agentic AI 架构,核心观点是将 deliberative 的语言推理与 determinstic 的执行授权分离。通过实验证明,虽然检索增强能显著改善 LLM 对技能的 grounding,但可靠的物理执行必须依赖于语言模型之外的约束强制执行机制。该框架通过类型化的技能库和确定性的编排器,实现了异构机器人团队在复杂任务中的安全、可靠协作。 |
|
| 08-23 |
From Diagnosis to Redesign: Using Quantitative Ethnography to Improve Multi-Agent LLM Reasoning 机构: University of California, Irvine; University of California, Los Angeles; Monash University; Columbia University; University of Pennsylvania 本文提出了一种利用定量民族志和认识网络分析来诊断和改进多智能体LLM系统的新范式。通过深入分析智能体间的话语交互模式,研究者成功识别了导致推理失败的结构化原因,并通过针对性的提示词重设计显著提升了系统性能。该方法超越了传统的黑盒评估,为理解和优化复杂多智能体系统的推理机制提供了可解释、可操作的路径。 |
|
| 08-23 |
Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations 机构: ETH Zurich, Tel Aviv University, Stanford University 本文指出“孤立对齐不等于群体对齐”。虽然个体安全的代理组成的群体可能在交互中被少数恶意代理捕获,但这种群体层面的脆弱性可以通过观察其良性互动来提前预测。此外,群体捕获是暂时且可逆的,增加推理透明度虽不能完全阻止强攻击,但能提供一定的缓冲。该研究为多代理系统的安全评估提供了新的视角和工具。 |
|
| 08-23 |
When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents 机构: Meituan; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences; MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences; Zhongguancun Academy 本文揭示了 LLM 智能体在技能记忆复用中存在的“技能模仿陷阱”,指出仅依赖成功轨迹会导致模型在语义相似但逻辑不同的任务中表现恶化。为此,作者提出了边界感知技能记忆(BASM),通过显式建模技能的适用边界、风险和恢复策略,将技能从无条件模板转变为状态感知的指导。实验证明,BASM 在多个基准测试中显著提升了成功率、准确性和安全性,同时减少了操作步骤,为构建更可靠的自我进化 LLM 智能体提供了新范式。 |
|
| 08-23 |
Coalition-Aware Skill Reliability for Self-Evolving Agents 机构: CASIA, LongShine AI Lab, SJTU, HKUST, USTC ## 文章做了什么 - 背景:基于大语言模型(LLM)的自进化智能体通过将交互轨迹提炼为“技能”并存储在技能库中,以实现从过往经验中学习。现有研究主要关注技能的获取、进化和检索等操作层面。 - 已有工作的不足:现有工作忽视了一个根本性的可靠性问题,即累积在技能库中的技能是否真正产生了积极的机制性贡献。孤立地评估技能无法反映其在特定组合(联盟)或跨域迁移后的真实效用,导致不可靠的技能被保留或错误迁移。 ## 文章的核心贡献点 - 提出了一个:技能机制可靠性审计框架(SMRA)及两种可靠性干预方法:联盟感知技能选择(CASS)和无监督技能掩码联盟优化器(u-SMCO)。 |
|
| 08-22 |
LLM Agents Perform Controlled Experiments Using Simulation Models 机构: University of Stuttgart, AstraZeneca 本文提出了一种将 LLM 与科学仿真模型相结合的多智能体框架,专门用于解决制药工艺设计等需要受控实验的科学工程问题。通过让 LLM 智能体在仿真环境中进行假设测试、干预和对比观察,系统克服了传统 LLM 输出缺乏证据支持的局限。实验结果表明,该方法在工业应用中能提供更具体、更正确且更有帮助的工艺优化建议,验证了仿真集成实验推理在实际科学发现中的潜力。 |
|
| 08-22 |
MemGuard: Persisting Verifier Signals for LLM-Agent Memory Governance 机构: Peking University, Queen Mary University of London, National University of Singapore, Shanghai Institute of Optics and Fine Mechanics (CAS), Nankai University, Technical University of Munich, Wuhan University, University of New South Wales ## 文章做了什么 - 背景:LLM 智能体正从单次提示使用转向长任务流(如终端操作、软件工程、Web 任务),可复用的记忆成为核心能力。然而,只有当存储的经验在数百次交互中保持可靠时,记忆才有用。 - 已有工作为什么解决不了:现有方法存在两个主要失效模式。首先是“不可靠的准入”:失败的轨迹、偶然的成功或误导性的观察因看似相关而被存入记忆,进而误导后续决策;其次是“记忆漂移”:长期运行的记忆库会积累重复、过时和冲突的记录,仅靠检索机制无法修复这些问题。 ## 文章的核心贡献点 - 提出了一个 MemGuard 框架:其核心区别在于将验证器输出不仅视为一次性过滤器,而是作为持久的生命周期元数据。 |
|
| 08-22 |
EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning 机构: School of Artificial Intelligence, University of Chinese Academy of Sciences; Institute of Automation, Chinese Academy of Sciences EDGE 提出了一种新的智能体强化学习范式,通过将外部经验从“推理时检索”转变为“训练时蒸馏”,解决了经验复用中的策略依赖性和外部依赖性问题。该方法不仅显著提升了长程复杂任务的性能,还实现了更轻量、更鲁棒的推理部署,为 LLM 智能体的持续学习和能力内化提供了有效路径。 |
|
| 08-22 |
GameXpert-Bench: How Far Are Coding Agents from Expert Game Development? 机构: Institute of Automation, Chinese Academy of Sciences; Tencent GameXpert-Bench 填补了游戏开发领域全生命周期评估的空白,通过细分生成、修复和优化三个阶段,提供了更细粒度的能力画像。研究结果表明,虽然 LLM 智能体能快速构建游戏原型,但在达到专家级开发水平(特别是调试和长期维护)方面仍有很长的路要走。该基准为未来提升代码智能体的鲁棒性和工程化能力提供了重要的评估标准和方向。 |
|
| 08-22 |
BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications 机构: The University of Georgia BioMed-Agent-RL 通过引入自适应强化学习和多模态元学习,解决了当前临床视觉大模型在复杂病例中存在的噪声、错位和幻觉问题。它突破了静态代理系统的局限,能够动态整合多模态专家知识,即使在视觉线索冲突或专家建议有误的情况下也能做出可靠推理。实验证明其准确率和鲁棒性均优于现有 SOTA 模型,为独立临床推理智能体的建立提供了新范式。 |
|
| 08-21 |
Specification Portability Across LLM Development Agents: Cross-Agent Compatibility in Specification-Driven Software Migration 机构: EPAM Systems 本文揭示了在异构 SDD 工作流中,规范不应被视为 Agent 中立的 artifacts。跨 Agent 的规范传递存在显著的质量退化风险,且不同 Agent 对规范的解读具有特异性。研究建议在多 Agent 软件工程中,必须明确考虑规范的可移植性、Agent 特定的解释机制以及基于检索的访问策略。检索增强被证明是提高跨 Agent 兼容性的有效手段,为未来构建互操作性更强的 LLM 开发代理生态系统提供了重要依据。 |
|
| 08-21 |
Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence 本文指出了从“个体智能”向“系统智能”演进的必然趋势,并正式提出了“图工程”这一新范式。通过构建显式、动态且不断演化的图结构,图工程为解决多智能体协作中的任务组织、异构协调及状态管理难题提供了统一的理论基础和方法论框架。该综述不仅梳理了现有研究,还为构建下一代可扩展、自适应的 LLM 智能体系统指明了方向。 |
|
| 08-21 |
ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents 机构: Shanghai Artificial Intelligence Laboratory ClawSentry 提出了一种针对自主 LLM 智能体的渐进式多层安全监控方案,解决了现有防御在跨阶段风险覆盖和状态感知上的不足。通过首次使用技能包审查、三层渐进式决策引擎以及会话级防绕过机制,它在多个主流智能体平台上实现了显著的攻击成功率降低,同时保持了极高的任务完成率,为智能体运行时安全提供了一个高效、通用的解决方案。 |
|
| 08-21 |
Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems 机构: Tampere University 本文针对 RAG 系统中存在的“安全-可靠性差距”,提出了一种基于评估代理的防御机制。通过融合 NLI 事实验证和多信号投毒检测,该代理能在生成前有效识别恶意检索内容,特别是在防御指令注入方面表现优异。尽管在处理细微语义篡改和跨域泛化上仍面临挑战,但该工作为构建可信赖的 RAG 系统提供了重要的在线防御思路和实用工具。 |
|
| 08-21 |
Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents 机构: National University of Singapore 本文提出了COTA框架,解决了LLM智能体运行时干预中辅助模型成本高和能力冗余的问题。通过引入仅基于比较的小型顾问模型,COTA能够在不要求辅助模型具备完整任务求解能力的前提下,提供有效的恢复方向。实验证明,该方法在多个复杂任务基准上均取得了优于现有方法的性能,展示了轻量级干预在提升智能体可靠性方面的巨大潜力。 |
|
| 08-20 |
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 机构: Tsinghua University, Navers Lab, Einsia.AI 本文提出了AI4AI-Bench,首个专注于评估LLM Agent设计训练算法能力的基准。研究发现,当前最先进的Agent在递归自我改进的关键环节——算法设计上表现依然薄弱,多数Agent倾向于保守策略而不愿或无法修改核心学习逻辑。然而,增加推理计算量可以显著提升Agent探索算法改进的意愿和效果。该基准的发布为未来衡量和提升AI系统的自我进化能力提供了重要工具。 |
|
| 08-20 |
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents 机构: KAIST, DeepAuto.ai PolicyGuide 创新性地结合了工作流执行的外部引导与运行时行为监控,解决了 LLM 代理在复杂多步任务中的合规性难题。通过将政策转化为可执行的工作流图并引入主动验证机制,它显著提升了代理在严格监管环境下的表现,特别是在高度结构化的领域(如电信)中效果显著,为构建安全、合规的客户服务代理提供了新的范式。 |
|
| 08-20 |
MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents 机构: Beijing Jiaotong University MileGPO 针对长程 LLM 智能体强化学习中的信用分配难题,提出了一种基于局部证据的图策略优化方法。通过里程碑发现、可靠性校准塑形和进展对比校准三个核心设计,该方法能够从稀疏的最终奖励中提取出细粒度的过程级信用,有效克服了传统基于距离的方法忽略中间进展和产生信用歧义的缺陷。实验证明其在多个复杂任务基准上达到了 SOTA 性能,且无需额外的计算或交互成本,为长程任务中的高效 RL 优化提供了新的思路。 |
|
| 08-20 |
Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay 机构: University of Southern California 本文通过引入基于执行回放的因果地面真值,彻底审计了LLM智能体训练中的步骤级信用分配机制。研究发现,当前主流的信用信号(裁判评分、对数概率比、自信度)均无法有效识别对结果有因果影响的步骤,其表现不优于随机猜测。现有的性能提升假象源于训练样本量的差异(训练剂量),而非信用信号的质量。论文强调,未来的信用规则比较必须匹配有效样本量,否则衡量的只是数据量而非信用准确性。这一发现对基于步骤奖励的LLM智能体训练范式提出了严峻挑战。 |
|
| 08-20 |
ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance 机构: HKUST, HKBU, NTU, Cornell University 本文指出金融合规评估不应简化为单一的合规分数,而应视为对基于规则的行动和证据使用的审计。通过引入 ReguSim 和 ReguBench,作者揭示了 LLM 代理在金融合规中存在的“行动差距”(action gap),即陈述的规则意识并不保证可执行的合规性。研究强调,有效的合规评估必须分离推理、动作、执行和证据四个维度,并指出在当前设置下,结构化方法在监控任务中仍具有竞争力。 |
|
| 08-19 |
SPADE: Self-Play in Adaptive Synthetic Executable Environments 机构: University of Washington SPADE 通过将环境设计本身变为一个可学习的组件,迈出了通向开放式自我改进的具体一步。它利用自博弈机制,让 LLM 同时担任环境设计者和解决者,通过基于遗憾的信号动态调整环境难度,有效解决了静态训练环境限制 agent 持续成长的问题,在多个复杂基准测试中取得了 state-of-the-art 的性能。 |
|
| 08-19 |
Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution 机构: University of Illinois 本文质疑了使用重型 LLM 进行智能体故障归因的必要性,提出了轻量级的 AFANet 框架。通过将多智能体交互轨迹建模为图结构,AFANet 以极低的计算成本实现了与昂贵 LLM 方法相当甚至更好的归因准确率。研究结果表明,有效的故障归因不需要沉重的 LLM 推理,轻量级且结构化的方法足以取得强劲性能,为解决 MAS 中的可解释性和调试问题提供了高效的新途径。 |
|
| 08-19 |
SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution 机构: Shanghai Jiao Tong University SkillForge 提出了一种新颖的主动式自蒸馏范式,通过合成问题来预先积累项目特定知识,并将其结构化为可检索的技能。这种方法有效解决了现有反应式方法在数据依赖性和推理成本上的局限性,显著提升了 LLM 智能体在特定项目中的问题修复能力和效率。 |
|
| 08-19 |
A Multi-Agent Platform for Automated Enterprise Analytics and Insight Generation 机构: Rakuten India Enterprise Private Limited 本文提出了一种用于自动化企业分析和洞察生成的多代理平台,通过结构化工作流解决了传统 BI 工具效率低和现有 AI 方案准确性不足的问题。该系统不仅在准确性和质量上显著优于单代理基线,还通过纵深防御安全和查询参数化机制满足了企业级部署的安全性和实用性需求,为对话式商业智能提供了可靠且可扩展的解决方案。 |
|
| 08-19 |
Sanyu Studio: A Multi-Agent System for Art-Historical Narrative Construction 机构: Renmin University of China, Georgia Institute of Technology, University of Cologne 本文提出了 Sanyu Studio,一个用于构建艺术史叙事的多智能体系统。通过将常玉的画作建模为智能体并引入记忆过滤机制,系统成功模拟了艺术史叙事的形成过程。研究表明,在设计良好的多智能体框架下,LLM 不仅能避免解读的同质化,还能在证据有限的情况下放大人类用户的能动性,为公众提供进入艺术史解读的交互式途径,支持多元艺术意义的生成。 |
|
| 08-18 |
Multi-Agent AI System for Radiology Report Structuring and Quality Assurance with Independent Radiologist Evaluation 机构: H. Lee Moffitt Cancer Center & Research Institute 本文提出并验证了一种本地部署的多智能体AI系统,能够有效将非结构化放射科报告转化为标准化的解剖学结构,同时执行严格的质量保证检查。系统在保留原始信息完整性的前提下实现了高准确率的结构化,并能有效识别报告内部的逻辑矛盾。专家评估证实了其临床安全性(无遗漏、无幻觉)和有效性,表明该系统有望促进放射科报告的标准化和质量提升。 |
|
| 08-18 |
Policy-Invariant Reward Shaping from LLM Feedback: A Framework for Hybrid RL Agents 机构: African Institute for Mathematical Sciences, Rwanda; AI Research and Innovation Nexus for Africa (AIRINA Labs), AI.Technipreneurs, Bénin; Sefako Makgatho Health Sciences University (SMU), South Africa; African Center for Advanced Studies (ACAS), Cameroon 本文主要解决了LLM与RL结合中的理论健全性问题,而非单纯的效率提升。通过将LLM反馈转化为有界势函数进行奖励塑造,论文从理论上证明了该方法在LLM评分不准确时仍能保持最优策略不变。这一贡献为混合智能体系统提供了坚实的理论基础,使其比现有的黑盒式LLM奖励方法更加可靠和可审计。未来的工作将侧重于大规模实证收敛性的研究。 |
|
| 08-18 |
EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection 机构: Alan Turing Institute, University of Oxford, National University of Singapore, NatWest AI Research, University of Edinburgh, University College London EvoTS-Agent 通过引入自进化机制和验证引导策略,有效解决了金融时间序列变点检测中因数据非平稳性和异质性导致的自动化难题。它摆脱了对专家经验的强依赖,通过 Revision、Alternative Strategy 和 Recombination 三种算子动态优化检测流程,不仅在性能上超越了现有 LLM Agent,还保证了极高的执行成功率,为金融领域的自动化分析提供了可扩展且适应性强的解决方案。 |
|
| 08-18 |
AdaLens: Interactive Storyline for Monitoring and Steering Long-Running Agentic Data Analysis 机构: Zhejiang University, Yonsei University AdaLens 解决了长周期智能体数据分析中可观察性和可引导性不足的问题。通过引入故事线可视化技术,它将复杂的分析过程结构化,并允许分析师在运行时进行基于上下文的干预。这项工作强调了在人机协作的数据科学工作流中,从“驱动者”到“监督者”角色转变所需的界面支持,为未来的智能体交互设计提供了重要参考。 |
|
| 08-18 |
StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows 机构: ByteDance Seed, Nanjing University, M-A-P, TokenWave.AI StartupBench 通过引入市场验证的AI初创产品工作流,填补了现有基准在真实性和评估细粒度上的空白。研究结果表明,尽管LLM进步显著,但当前通用智能体在可靠完成复杂的、市场驱动的真实用户任务方面仍有很大提升空间,特别是在复杂指令遵循和领域专长方面。该基准为衡量AI向真正实用的端到端助手演进提供了重要的实证依据。 |
|
| 08-17 |
PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning 机构: Technical University of Berlin 本文针对LLM在长视野规划中的不可靠性及现有混合方法评估缺失的问题,提出了PDDLCoder代理框架和NL-pddlgym基准数据集。通过迭代生成与自动验证机制,PDDLCoder显著提高了PDDL生成的准确性和计划的可适用性,大幅超越了基线方法。该工作不仅展示了代理式符号规划的优势,还为LLM辅助规划研究建立了重要的标准化评估基准。 |
|
| 08-17 |
Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning 机构: Writer, Inc. Palmyra x6 技术报告展示了一种“少即是多”的后训练范式。通过精心设计的锚定监督微调(ASFT)和先进的优化器(Muon),研究者仅用极少量的合成数据(626 条轨迹)和单轮训练,就在不损害基础模型通用能力的前提下,显著提升了模型在企业级代理任务(如工具调用、多步规划)中的性能。该方法不仅在公共基准上取得了领先地位,更在实际企业应用场景中证明了其高效性和实用性,为资源受限下的高性能模型定制提供了重要参考。 |
|
| 08-17 |
Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs 机构: Tencent Zhuque Lab 本文针对第三方托管 LLM API 的验证难题,提出了 Ventor-QTest 黑盒审计框架。通过引入平均保真度损失(AFL)和极端保真度损失(EFL)两个指标,该方法在不依赖目标 API 概率信息的情况下,有效量化了部署行为与可信参考之间的偏差。实验表明,EFL 与长程代理任务的性能下降密切相关,强调了在审计复杂应用场景时联合监控平均偏差和极端偏差的重要性。 |
|
| 08-17 |
AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment 机构: Beihang University 本文提出了 AeroCopilotBench 和 ACOE,填补了航空领域 LLM 智能体在交互式环境下的评估空白。通过双层基准和安全门控机制,系统性地评估了智能体的知识应用、交互执行和操作安全性。研究结果表明,当前模型在将静态知识转化为安全、完整的程序执行方面仍存在显著挑战,为未来开发更可靠的航空辅助智能体提供了重要的评估基础和方向指引。 |
|
| 08-17 |
Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory 机构: University of Southern California BATON 通过将长程任务分解为独立的子任务探索单元,并引入精细的转换感知记忆机制(包括调用、交接和前瞻转换),有效解决了长程机器人操作中误差累积和状态不兼容的问题。该方法在不更新参数的情况下,显著降低了探索成本并提升了长程任务的成功率,证明了模块化探索与状态管理在复杂机器人任务中的重要性。 |
|
| 08-16 |
TaoLive Digital Avatar Agent Technical Report: Training Agents to Evolve with Their Harness 机构: TaoLive AIGC LLM Team 本文针对直播电商数字人主播面临的低延迟与高适应性矛盾,提出了可演化的 Harness 架构及 Harness-Aware Training (HAT) 方法。通过 Harness-State Augmentation 和三阶段训练策略,成功训练出一个紧凑的 35B 模型,使其能够在不重新训练权重的情况下适应运行时环境的频繁变化。实验表明,该方法在实时问答准确率上超越了最强的通用大模型,同时保持了良好的通用指令遵循能力和符合生产要求的低延迟,解决了小模型过拟合与环境演化之间的核心冲突。 |
|
| 08-16 |
When Stories Evolve: Benchmarking LLM Storytelling Across Agent Architectures in Open-Ended World Simulations 机构: The University of Hong Kong, Peking University, Tsinghua University, Beijing Institute of Mathematical Sciences and Applications 本文引入了WSE-bench,这是一个针对开放世界模拟中LLM叙事的过程基准测试。通过将评估重点从最终产物转移到创作过程,该研究揭示了持续生成、规范一致性和有意义发展是三个 distinct 且常相互竞争的能力维度。研究发现模型规模主要利好生成长度,而对一致性和丰富度帮助有限,且二者间存在复杂的非凹帕累托权衡。这一基准为理解和优化AI原生游戏及动态叙事系统中的代理架构提供了新的视角和工具。 |
|
| 08-16 |
Schema-Agnostic Graph Reasoning Agent for Hybrid Knowledge Graphs 机构: Oplit 本文提出了 GRA,一种模式无关的图推理代理,通过将代码库导航的通用原语应用于混合知识图谱,实现了在运行时动态发现领域知识。实验表明,在工业级基准 UFK-M 上,GRA 通过选择性导航结构化数据,不仅在准确率上超越了全上下文方法,还显著降低了令牌消耗。研究核心结论为:在结构化基底上进行选择性导航优于穷尽式的上下文输入,且工具调用的可靠性是关键成功因素。 |
|
| 08-16 |
Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback 机构: Google Cloud Agent Gym 解决了 LLM 智能体在生产环境中因行为冻结而无法适应动态业务规则的核心痛点。通过引入人机回环的持续演进机制、无真值合规验证架构以及程序化安全循环,它使得非技术人员(领域专家)能够直接参与智能体的优化与维护。这不仅降低了维护成本,还提高了智能体在面对边缘情况和规则漂移时的鲁棒性和适应性,为 LLM 智能体的长期可持续部署提供了可行的技术路径。 |
|
| 08-16 |
MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration 机构: State University of New York at Buffalo MistyPilot 通过多智能体 LLM 架构成功解决了社交机器人自然语言编程中的关键难题,实现了反应式物理行为与有状态社交行为的无缝协同。其特有的任务路由和结果复用机制不仅提高了指令执行的准确性和效率,还降低了非专家用户的使用门槛。实验证明,该框架在真实机器人部署中具有高准确性和良好的用户体验,为社交机器人的普及应用提供了新的技术路径。 |
|
| 08-15 |
Anatomy of a Quantized Agent: VRAM Stability and Forecasting in Code-Synthesis Agentic Workloads 机构: Nokia Germany 本文通过对量化智能体工作负载的深入分析,揭示了在高度量化、权重主导的推理场景中,显存消耗具有极高的稳定性。研究证明,透明且校准后的闭式解析模型足以胜任显存峰值预测任务,其性能不亚于甚至优于复杂的机器学习模型。这一发现挑战了部署复杂预测模型的必要性,为资源调度和准入控制提供了低成本、高可靠性的基础,有助于推动智能体在共享集群和边缘基础设施上的高效、安全部署。 |
|
| 08-15 |
TwinGridShield: Consequence-Aware Runtime Authorization for LLM Grid-Agent Actions 机构: West Virginia University TwinGridShield填补了LLM代理在电网操作中缺乏物理后果验证的空白。通过引入基于数字孪生的运行时授权层,它有效地解决了LLM“动作盲区”和提示注入带来的物理安全风险。在理想模型匹配下,它能完全阻止不安全动作;但在模型存在误差时,其防护能力会受到一定影响,强调了维护高保真数字孪生模型对于此类安全机制至关重要。 |
|
| 08-15 |
Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL 本文通过提出基于推理自主性的分类法,解决了 LLM Text-to-SQL 领域因实验设置异构导致的比较困难问题。通过构建可追溯的聚合排行榜和进行实证案例研究,文章揭示了自主性、鲁棒性与成本之间的复杂关系,并指出推理内化是一种有效的中间路径。发布的 Python 工具包为未来研究的标准化比较提供了基础设施。 |
|
| 08-15 |
VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? 机构: HKUST(GZ), Tencent 本文提出了VibeWorlding框架,解决了现有3D世界构建代理评估标准单一和缺乏有效训练机制的问题。通过构建大规模的VWE-BENCH基准和支持RL训练的VibeWorlding-Gym环境,证明了强化学习后训练能显著提升开源多模态大模型在复杂3D场景构建任务上的性能,使其达到甚至超越当前最先进的闭源模型水平。 |
|
| 08-15 |
LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset 本文提出的 LAPF 框架通过构建包含感知、记忆、规划和行动的闭环认知架构,有效克服了现有 LLM 辅助导航方法在代理功能上的局限。实验结果表明,LAPF 不仅在路径规划效率上优于传统的 CoT 提示方法,更在复杂动态环境中的安全性和稳定性方面表现出显著优势,实现了零控制异常事件,为无人机在城镇规模户外环境中的自主导航提供了新的解决方案。 |
|
| 08-14 |
HERMES: a multi-agent framework for structured knowledge extraction from ultra-long documents in geoscience 机构: Zhejiang Laboratory HERMES 提供了一个实用的路径,将历史科学文献转化为面向FAIR的结构化数据。通过多智能体协作、领域约束集成和证据追踪,它克服了超长、多模态科学文档处理的难题,为数据密集型学科和大规模知识集成提供了可持续的基础设施。 |
|
| 08-14 |
A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents 机构: Digital Excellence Center, Assystem EOS, France 本文针对自主 LLM 智能体在真实世界中面临的行为漂移问题,提出了一种基于图的强化学习恢复框架。通过将恢复过程分解为多个专用节点,并利用混合奖励机制训练小型语言模型,该方法实现了高效、结构化且语义准确的漂移诊断与恢复。这不仅解决了大型模型无法频繁重训的限制,还有效降低了因漂移导致的外部系统不可逆损害风险,在 AppWorld 基准测试中展现了良好的性能。 |
|
| 08-14 |
AgentRewind: Recoverable Execution for Long-Horizon LLM Agents 机构: University of Chinese Academy of Sciences AgentRewind 针对长周期 LLM 智能体执行中错误难以恢复的问题,提出了一种基于检查点回滚和记忆引导的运行时恢复框架。通过允许智能体回溯到早期状态并吸取历史教训,该方法有效解决了错误传播问题,在 MettleBench 基准测试中展现了优于现有计划细化和安全检查方法的性能,为提升长周期任务的可靠性提供了新范式。 |
|
| 08-14 |
Clearing the Fog: Towards Installing and Refining Proactive Exploration Capabilities in LLM Agents 机构: Sichuan University, National University of Singapore, University of Leeds 本文针对LLM智能体在复杂交互环境中缺乏主动探索能力的问题,指出了现有SFT-RL范式中数据偏差和训练机制的缺陷。通过提出SAFARI框架,结合合成探索丰富数据的SFT阶段和引入对比信号引导的RL阶段,成功赋予了智能体主动探索的能力。该方法不仅提升了智能体在长程决策任务中的表现,也为理解和发展具身智能体的探索行为提供了新的视角。代码已开源。 |
|
| 08-14 |
SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning 机构: State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China SheetCompass 解决了 LLM 在处理复杂电子表格时因结构扁平化而丢失空间语义的关键问题。通过引入分层关系图来显式建模表格内部及之间的结构关系,并结合双层记忆机制和多代理协作框架,该方法有效增强了代理在复杂工作流中的规划、执行和自我修正能力,实现了电子表格自动化推理性能的显著提升。 |
|
| 08-13 |
MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning and Coordination 机构: University of California, Davis; University of Pennsylvania; Drexel University ## 文章做了什么 - 背景:大型语言模型(LLM)在医学领域(如放射报告生成、临床问答)展现出巨大潜力,但目前的部署多依赖于单体提示策略(monolithic prompting),即单个LLM实例同时负责提取、推理、验证和动作生成。 - 已有工作为什么解决不了:单体策略限制了模型潜力的发挥且缺乏可解释性。临床决策通常需要多源上下文信息和多步推理,而现有的单体方法难以处理这种复杂的顺序推理、验证及异构信息整合需求,导致可靠性、透明度和患者安全保障不足。 ## 文章的核心贡献点 - 提出了一个 MARC (Multi-Agent Reasoning and Coordination) 框架:这是一个开源的、确定性的多智能体编排框架,旨在替代临床推理中的单体LLM提示。 |
|
| 08-13 |
Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes 机构: University of Central Lancashire 本文探讨了利用小语言模型(SLMs)和边缘计算来增强具身虚拟代理的认知能力。通过在NVIDIA Jetson Orin NX上部署Qwen2.5模型,研究验证了SLM在支持CEAA架构中“思考”和“记忆”组件方面的有效性。实验结果显示,该系统能够在资源受限的边缘环境中实现低延迟、上下文感知的交互,为开发在元宇宙等复杂虚拟环境中高效运行的智能代理提供了可行的技术路线和实证依据。 |
|
| 08-13 |
Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents 机构: Zhejiang University, Shanghai Innovation Institute, AWorld Team (Inclusion AI), Westlake University, Nanjing University 本文针对多轮多步 LLM 智能体训练中的信用分配难题,提出了 CrEST 框架。该框架创新性地结合了 RL 的验证器上限优势和蒸馏的密集信号优势。通过轮次分割的优势计算解决轮间信用混淆,通过熵门控的教师幅度调制解决轮内梯度集中和教师上限问题。实验表明,CrEST 在复杂的多轮工具使用任务中显著提升了智能体的性能和鲁棒性,为高效训练自主 Agent 提供了新的范式。 |
|
| 08-13 |
SkillShapley: Boundary-Adaptive Shapley Valuation for Skill Step Attribution in LLM Agents 机构: Beihang University, Shandong University 本文解决了 LLM 代理技能中细粒度步骤归因的开放性问题。通过提出 SkillShapley 框架,利用边界自适应的 Shapley 估值方法,克服了离散奖励带来的采样难题和组合爆炸的计算瓶颈。实验证明该方法能准确量化步骤贡献,指导更高效的技能设计与优化。 |
|
| 08-13 |
Beyond Handcrafted Security: Towards Self-Evolving Defense for LLM Agents 机构: University of Minnesota, Ant Group, Tsinghua University, Zhejiang University 本文指出了当前 LLM 智能体运行时防御依赖人工设计、缺乏系统性框架的局限性。通过提出 harness-level 的形式化理论,作者构建了 HARD 框架,实现了防御机制的自主进化。实验结果表明,HARD 不仅在多种静态和自适应攻击场景下显著降低了攻击成功率,还有效保持了智能体的良性任务效用,为部署后的 LLM 智能体提供了一条持续自我完善的安全防护新范式。 |
|
| 08-12 |
One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL 机构: Northeastern University, New York University, UC Berkeley, University of Washington, Stanford University 本文揭示了在多智能体RL中使用单一冻结LLM作为模拟器会导致严重的“模拟器崩溃”问题,致使策略过拟合且泛化能力差。通过理论分析和实证研究,作者提出了推理时的言语化采样和训练时的协同训练两种方法,有效缓解了模式崩溃,显著提升了策略在 unseen simulators 和真实用户上的泛化性能。研究强调,训练环境的多样性对于多轮RL在现实世界部署中的泛化能力至关重要。 |
|
| 08-12 |
Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control 本文通过理论分析和实验验证,解决了 LLM Agent 控制路径中的 GPU 利用率低和主机往返开销大问题。首先,通过“就绪队列”框架量化了 GPU 并发执行的潜在机会,证明精确打包能大幅恢复因固定窗口损失的性能。其次,通过保持路由决策在 GPU 设备端,避免了不必要的主机通信,实现了 1.19x-2.39x 的加速。这项工作为构建高效的 LLM Agent 系统提供了具体的系统设计指导,强调了截止期管理和数据放置的重要性。 |
|
| 08-12 |
Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents 机构: Huazhong University of Science and Technology, Microsoft Research, Microsoft, University of Illinois Urbana-Champaign 本文通过实证研究揭示了 LLM Agent 中“技能”可能带来的危害。作者提出的差分分析框架和 SkillTriage 工具有效地隔离并归因了技能引起的失败。主要发现表明,看似相关的技能往往会导致智能体在实现上出错或遗漏关键步骤,而效率上的损失主要源于技能强加的过度验证和复杂流程,而非简单的Prompt长度增加。这些发现为未来更安全、更具成本意识的技能重用提供了研究方向和工具改进建议。 |
|
| 08-12 |
The Sleeping Agent: What Gist-Based Context Compression Loses and Why 本文通过引入生物启发的 SWC 框架,深入剖析了基于要点的上下文压缩在长程智能体中的得失。研究明确指出,通用压缩失败的主要原因是对时间锚点的系统性忽略,而非压缩本身无效。通过极简的提示词工程修复,可以在保持其他信息完整性的同时大幅恢复时间推理能力。这项工作为记忆架构设计提供了重要原则:应在压缩过程中显式保护时间锚点,而非依赖通用抽象。 |
|
| 08-12 |
LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation 机构: Peking University LoongReflect 解决了长视野智能体中反思学习的核心难题,即局部反思动作与全局任务结果之间的监督不匹配问题。通过将反思建模为记忆控制策略,并结合全局视角蒸馏(快速通道)与基于结果的轨迹优化(慢速通道),该方法有效地提升了智能体在复杂推理任务中的规划、纠错和最终成功率。 |
|
| 08-11 |
Who Are You Explaining To? A Multi-Agent System for Audience-Aware XAI Narratives 机构: Politecnico di Bari 本文针对XAI解释在不同受众间传达的难题,提出了XstrAI多智能体框架。通过固定底层证据并分离规划、实现与验证过程,有效解决了LLM生成中的忠实度问题和受众适配问题。实验证明,该方法在保持技术准确性的同时,显著提升了面向非专家和专家用户的解释质量和适用性,代码已开源。 |
|
| 08-11 |
GitSkills: A Dataset of Agent Skills on GitHub 机构: University College London 本文介绍了 GitSkills,这是第一个大规模公开可用的 Agent Skills 数据集,涵盖了 2026 年 7 月之前 GitHub 上的近 380 万个技能文件。该数据集解决了因 Agent Skills 的非传统特性(自然语言、概率加载、去中心化)而导致的研究数据缺失问题。通过提供详细的文件内容、元数据和复用追踪信息,GitSkills 为软件工程社区研究 LLM 代理技能的采用、维护、安全性和最佳实践奠定了基础,有助于理解这一新兴软件工件的演化规律。 |
|
| 08-11 |
VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World? 机构: Xiaohongshu Inc 本文指出了现有 LLM 代理评估在日常生活辅助场景下的缺失,提出了 VibeLifeBench 基准,旨在衡量代理在动态、长周期环境中的主动性和持久性。通过模拟真实世界的自发变化和隐含约束,该基准揭示了当前前沿模型在处理复杂生活任务时的显著局限性,为未来开发更可靠的生活助手提供了明确的评估标准和方向。 |
|
| 08-11 |
REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems 机构: Fudan University, The Hong Kong University of Science and Technology, Alibaba Cloud Computing, Soochow University REDAgentBench 通过引入可执行的红队测试框架,解决了现有LLM智能体安全评估中因混淆认知与执行、依赖单一文本视图而导致的测量偏差问题。它不仅揭示了智能体系统中普遍存在的“认知-执行差距”,还证明了基于状态和执行结果的忠实测量对于提升安全评估准确性和指导有效安全干预的重要性。 |
|
| 08-11 |
Agentic Configuration Management (ACM): A Reference Configuration Model for Governed Agentic Systems 机构: PwC 本文介绍了代理配置管理(ACM),填补了传统软件配置管理原则与现代智能体系统之间的空白。通过引入不可变的配置项、显式基线、生命周期管理和形式化的影响传播语义,ACM 成功地将异构智能体配置标准化。研究证明,通用治理语义可以有效支持跨不同框架的智能体系统的 reproducibility(可复现性)和 auditability(可审计性),为 governed agentic systems(受治理的智能体系统)提供了坚实的理论和工程基础。 |
|
| 08-10 |
Stealing Reasoning Traces from Proprietary LLM APIs 机构: ELLIS Institute Tübingen, University of Tübingen, Max Planck Institute for Intelligent Systems 本文揭示了主流 LLM API 在处理客户端加密推理痕迹时存在的严重架构漏洞。通过利用加密块在生态系统内的互操作性,攻击者可以利用弱模型作为“解密 oracle”来窃取强模型的推理过程。这不仅威胁到模型的知识产权,还导致了大规模的用户隐私泄露和潜在的系统投毒风险。论文在负责任披露后,提出了具体的密码学和系统级缓解措施,建议提供商实施严格的绑定机制(如将会话 ID、模型版本与加密块绑定)以防止此类跨模型重用攻击。 |
|
| 08-10 |
SHE: Trajectory-driven Safety Harness Evolution for LLM Agents 机构: Shanghai Artificial Intelligence Laboratory SHE 框架解决了 LLM 智能体安全 harness 静态且耦合的问题。通过解耦 harness 组件并建立基于轨迹归因的自动化演进循环,SHE 实现了安全边界的动态优化。实验证明该方法在显著提升安全性的同时保持了有用性,并具备优秀的泛化和跨模型迁移能力,为智能体安全提供了一种可演进的解决方案。 |
|
| 08-10 |
Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy 机构: Pacific Northwest National Laboratory 本文提出了一种名为“Agentic Harnesses”的LLM驱动验证层,旨在解决机器人自主系统中规划动作的安全性与伦理问题。通过采用多模型集成的“法官”机制,该方法有效克服了单一模型的局限性,在规划与执行之间建立了可靠的安全网关。实验结果表明,该系统在保证高精确率的同时,能极大程度地遏制对抗性攻击,为构建更安全、可信的无人监督机器人自主系统提供了新的架构思路。 |
|
| 08-10 |
Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models 机构: University of British Columbia 本文提出了 Model Discovery Agent (MDA),通过结合 LLM 的假设生成能力与贝叶斯实验设计的严谨性,解决了在昂贵实验条件下高效发现机制性世界模型的难题。MDA 特别适用于 M-open 场景,能够通过预测检查和假设空间扩展来应对未知机制。实验结果表明,该方法在多个科学领域均达到了状态-of-the-art 的性能,为自动化科学发现提供了强有力的工具。 |
|
| 08-10 |
Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents 机构: Fudan University, Zhejiang University, East China Normal University, Alibaba Group 本文针对基于技能的 LLM 智能体在利用外部指导时面临的监督稀疏问题,提出了 BCSD 框架。通过引入双向上下文自蒸馏机制,BCSD 能够从增强和缩减两个互补视角提取细粒度信号,有效提升了智能体对技能的利用能力。实验结果表明该方法在多个基准任务上均达到了 SOTA 性能,为提升 LLM 智能体的技能利用效率提供了新的思路。 |
|
| 08-09 |
Business Arena: Benchmarking LLM Agents in a Realistic Marketplace 机构: Alibaba Group, Yale University Business Arena 为评估端到端商业智能体迈出了第一步,提供了一个现实且可信的测试平台。通过结合真实数据、多维度的评估指标(利润、技能水平、动作归因)以及严格的消融实验,该研究不仅量化了当前LLM智能体在商业领域的性能差距,还深入剖析了其决策机制和经营风格。结果表明,尽管LLM智能体在处理复杂工作流方面取得了进展,但在面对噪声证据、延迟反馈和动态环境时的商业决策能力仍有显著提升空间,且目前仍无法媲美人类专家的策略水平。 |
|
| 08-09 |
Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents 机构: National Taiwan University 本文填补了AI教学能力评估的空白,首次提出了针对PCK能力的“Teaching Monster Challenge”。研究指出当前AI在内容生成上已成熟,但在个性化教学适配上仍有不足。同时,论文揭示了自动评估工具在高分段的失效问题,并开源了相关资源,为未来开发更强大的教学AI及更精准的自动评估模型提供了基础测试床。 |
|
| 08-09 |
SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests 机构: Beijing University of Posts and Telecommunications 本文针对 LLM 智能体在隐含用户请求下的技能检索难题,提出了 SkillReason 框架。通过引入大规模跨领域基准 SkillReason-Bench,并利用两阶段训练策略(教师模型监督内化推理 + GRPO 优化推理轨迹),成功让检索器学会了“像专家一样思考”潜在的能力需求,同时保持了推理阶段的高效性。该方法显著提升了技能检索的准确率,为构建更强大的代理系统提供了重要支持。 |
|
| 08-09 |
ForestBench: A Unified Graph Framework for Evaluating Multi-Agent Collaboration 机构: Southwest University, Tencent, Institute of Computing Technology, Chinese Academy of Sciences ## 文章做了什么 - 背景:基于大语言模型(LLM)的多智能体系统(MAS)发展迅速,其核心优势在于通过规划、执行、批评等角色的分工协作来解决复杂问题。然而,新框架的涌现速度远超评估能力的提升。 - 已有工作的局限:现有的结果导向基准(如GSM8K、HumanEval)仅关注最终答案,丢弃了体现MAS价值的协作过程;而过程感知的评估方法存在严重缺陷:原生执行轨迹依赖于特定框架的事件模式和通信协议,导致不同方法间无法横向比较;使用“LLM作为裁判”的方法则需要额外的模型推理,成本高且受限于裁判模型的选择和评分标准,缺乏一致性和稳定性。 ## 文章的核心贡献点 - 提出了一个 ForestBench:这是一个通用的评估框架,将异构的MAS原生执行轨迹映射到统一的协作图空间中,使得不同的多智能体方法可以在相同的表示、参考集和指标面板下进行公平评估。 |
|
| 08-09 |
Unaccountable Delegation, Fading Skills: Mapping the Risks of Workplace AI Agents 机构: King's College London, Nokia Bell Labs, University of Sussex, Politecnico di Torino 本文指出职场 AI Agent 的风险不仅源于 Agent 本身,还取决于人与 Agent 的协作方式及部署模式。通过构建专门的多层框架和风险分类法,研究揭示了自动化与增强模式下的不同风险特征,强调了设计良好的人机协作机制对于构建更安全职场的重要性,为组织提供了更精准的风险识别和管理工具。 |
|
| 08-08 |
STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs 机构: Indian Institute of Technology, Delhi 本文指出了知识蒸馏过程中可能被忽视的风险:学生模型不仅学习功能知识,还可能继承教师模型的行为模式和身份特征,导致输出同质化和责任归属模糊。为此,作者提出了 STEMMA 框架,通过多智能体协作和对抗性提示系统地评估 LLM 的自我身份一致性。实验证明,当前主流模型在此类对抗性测试中表现出显著的脆弱性,强调了在模型开发和部署中关注身份一致性和行为透明度的重要性。 |
|
| 08-08 |
Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives 机构: University of Macau, Westlake University, Harbin Institute of Technology (Shenzhen), University of Cambridge, University of Aberdeen 本文指出了LLM在互动叙事中长期被忽视的“叙事承诺保持”问题,并发布了NCP-Bench基准。研究发现,当前顶尖LLM在长程交互和对抗性用户输入面前,难以维持逻辑一致性和叙事完整性,事实冲突率高,生存率低。这为未来开发更具鲁棒性和一致性的叙事AI代理提供了重要的评估标准和研究方向。 |
|
| 08-08 |
The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World 机构: Carnegie Mellon University 本文指出当前 LLM Agent 路由评估中存在的根本性缺陷:静态重放评估错误地假设轨迹是开环的,忽略了模型切换对环境状态的连锁反应。通过引入分支 rollout 方法,作者证明了模型切换会导致轨迹迅速且大幅度的分歧,且重放评估在预测最终结果上完全失效。研究还揭示了推理服务配置(如 FP8 vs AWQ)对确定性的显著影响。作者发布了相关 harness 和轨迹数据,呼吁社区采用更真实的动态评估方法来指导 Agent 路由的研究与部署。 |
|
| 08-08 |
LatticeMind: A Conflict-Aware Memory Primitive for Multi-Agent Systems 机构: University of Science and Technology of China LatticeMind 通过将矛盾处理视为记忆问题而非单纯的回答选择问题,提出了一种新的多智能体系统记忆原语。它通过结合廉价符号检查和选择性 LLM 协调,实现了高效且高精度的冲突管理。实验证明其在处理知识冲突方面显著优于现有基线,尽管在复杂规划任务中仍有局限,但为构建具有持久冲突感知能力的多智能体系统提供了重要基础。 |
|
| 08-08 |
Compositional Threat Analysis of Latent Compromise in LLM Agent Systems: The Order 66 Scenario 机构: RIKEN Center for Computational Science 本文通过将“66号指令”隐喻转化为对使用工具的LLM代理系统的起源中立安全分析,揭示了一种由休眠规则、激活触发和代理权限组成的复合威胁。文章指出,单一的防御手段不足以应对这种组合攻击,最有效的防御策略包括独立的能力中介、持久状态溯源、传播隔离以及受保护的恢复机制。尽管目前尚无完整的公开攻击案例,但该威胁模型为未来LLM代理系统的安全架构提供了重要的理论依据和防御指导。 |
|
| 08-07 |
NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs 机构: Vishwakarma Institute of Technology Niyam-AI 提出了一种创新的 AI 代理安全范式,通过结合意图合约和零知识证明,解决了传统基于信任的安全机制无法提供可验证保证的问题。它不仅在与现有主流安全基线(NeMo, Prompt Guard 2, GPT-OSS-Safeguard)的对比中展示了更高的准确性和更低的误报率,还首次实现了无需暴露模型权重即可由第三方独立验证的安全执行证明。尽管引入了一定的计算延迟,但其提供的数学级可验证性为高风险环境下的自主 AI 代理部署奠定了新的信任基础。 |
|
| 08-07 |
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory 机构: KAIST, DeepAuto.ai 本文针对小型 LLM 智能体因成功轨迹稀缺而导致记忆系统失效的问题,提出了 Agent Memory Distillation (AMD) 框架。通过构建包含工作流、子任务和函数三个层级的分层记忆,并结合主动注入与被动检索机制,AMD 有效地将大型教师模型的知识蒸馏给小型学生模型。实验表明,该方法在多个基准测试上显著提升了小型智能体的工具使用能力,且无需额外的训练成本,为资源受限环境下的高性能智能体部署提供了新思路。 |
|
| 08-07 |
SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent 机构: Hong Kong University of Science and Technology ## 文章做了什么 - 背景:大型语言模型(LLM)智能体通过积累“技能”(轻量级、可重用的文本工件)来适应重复性任务,而无需更新模型权重。当前的研究重点已从静态技能合成转向技能进化,即通过迭代执行、失败诊断和文本空间更新来优化技能。 - 已有工作的不足:现有的技能进化框架存在两个主要缺陷:一是缺乏明确的“诊断-结果”反馈闭环,生成的诊断补丁通常直接提交,未经验证其实际效果;二是将删除视为通用的编辑操作,缺乏专门的知识巩固机制,导致技能随着迭代不断膨胀,包含冗余或冲突的信息,干扰有用知识的发挥。 ## 文章的核心贡献点 - 提出了一个 SkillProx 框架:这是一种受近端梯度下降启发的“前向-后向”框架,将闭环诊断进化与效用感知的近端 refinement 相结合,旨在平衡任务损失和技能复杂度。 |
|
| 08-07 |
Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing 机构: Stanford University, University of Wisconsin–Madison 本文揭示了当前LLM代理在假设检验中缺乏可靠统计推理的问题,即虽然代码执行正确但统计推断存在细微错误。通过构建专注于统计有效性的新基准 P-Bench 和引入经过强化学习训练的 Fisher-R1 代理,文章证明了在具有验证统计奖励的任务上进行强化学习可以大幅提高LLM在科学假设检验中的可靠性。Fisher-R1 在多个领域和难度级别的任务上均优于现有的最先进模型,为自动化科学发现提供了更可信的工具。 |
|
| 08-07 |
An Agentic Hybrid Top-Down and Bottom-Up Approach to Knowledge Graph Generation 机构: Malt 本文提出了一种创新的混合知识图谱生成方法,有效解决了 HR 领域中多语言、非标准化技能数据的组织难题。通过结合 Wikidata 的权威 grounding 和 LLM 代理的灵活生成能力,该方法克服了传统自顶向下方法缺乏灵活性和自底向上方法缺乏结构性的缺点。实验表明,该流水线能够自主适应噪声数据,生成高质量、可解释且动态更新的技能知识图谱,为人才匹配等应用提供了坚实基础。 |
|
| 08-06 |
AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games 机构: Tsinghua University AV-AIVAT 成功地将方差缩减技术转化为高效、可审计的早期停止机制。它通过分离渐近筛选和精确认证,解决了不完全信息游戏中智能体评估成本高、噪声大的问题。该方法不仅保证了在任意时刻停止的统计有效性,还允许第三方在停止时刻重新验证结论,为 LLM 智能体在博弈环境中的评估提供了一种经济且严谨的新标准。 |
|
| 08-06 |
Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents 机构: IBM Research 本文针对任务型对话智能体基准测试质量评估缺失的问题,提出了一种基于LLM裁判的无参考评估框架。该框架通过衡量一致性、复杂性和策略覆盖率,有效识别基准中的缺陷。实验验证表明,该方法与人类判断高度一致,并能灵敏地区分不同质量的基准。这为开发者和研究人员提供了一套实用的工具,用于提升合成及人工策划基准的可靠性,确保对话智能体评估结果的真实性。 |
|
| 08-06 |
ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment 机构: Istanbul Technical University ECHO 是一个针对慢性病管理的端到端本地化代理健康助手。它通过引入时序知识图谱解决了长期护理中的记忆一致性问题,通过两阶段混合护栏确保了医疗交互的安全性,并通过多模态语音分析增强了情感感知能力。该系统在保护患者隐私的前提下,实现了高性能的临床工具调用和安全分类,为本地部署的医疗AI提供了可行的技术路径。 |
|
| 08-06 |
FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India 机构: Indian Institute of Science 本文针对印度农村低识字率人群的社会福利注册难题,提出了 FormBharo 语音代理系统。通过结合 LLM 与确定性规则控制,解决了真实声学环境下语音识别错误导致的性能下降问题,并在严格资源约束下实现了高效的自动化表单填写。研究强调了端到端评估的重要性,指出组件性能不能代表最终任务效果,并通过新发布的基准测试和帕累托优化策略,为资源受限场景下的语音AI部署提供了重要参考。 |
|
| 08-06 |
Hardware Keystores for AI Agent Signing Workflows: A Zero-Trust MCP Enforcement Architecture 机构: Hardware Systems Security Lab (HSSL), Huawei Technologies & EPITA 本文指出当前 AI Agent 密钥管理的结构性弱点在于密钥必然短暂存在于软件内存中,易受提示词注入攻击。作者提出了一种基于硬件密钥库的零信任架构,通过 PKCS#11 接口将密钥操作完全限制在硬件边界内,并辅以五层安全强制机制。实验证明,该方案能将提示词注入攻击的成功率从 19.3% 降至 0%,且无误报,为 AI Agent 的加密工作流提供了实质性的安全保障。 |
|
| 08-05 |
SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System 机构: University of Minnesota SparseDitto 通过结合轻量级统计模型与 LLM 驱动的智能体系统,解决了稀疏矩阵计算中因稀疏模式多样性和硬件差异性导致的性能优化难题。它不再依赖单一的固定实现,而是为每个工作负载动态生成最优 GPU 内核,显著提升了稀疏算子在多种 GPU 架构上的执行效率,展示了 LLM 在系统底层优化中的巨大潜力。 |
|
| 08-05 |
A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination 机构: Shanghai AI Laboratory, University of California at Los Angeles, Tongji University A-SR 是一种创新的自我进化代理框架,专门用于解决符号回归中的复杂搜索问题。它通过引入基于角色的协调协议、在线评估反馈机制和状态路由记忆,克服了传统方法将异构失败简单化的缺陷。该方法不仅在合成基准测试中大幅超越了现有基线,还在真实科学发现任务中展现了卓越的准确性和泛化能力,证明了分层协调和多智能体协作在提升 LLM 科学推理能力方面的巨大潜力。 |
|
| 08-05 |
EASy: Towards Efficient LLM-Based Agentic System 机构: Monash University EASy 通过引入显式的执行器成本/能力感知和强化学习训练的编排器,解决了现有智能体系统忽视执行效率的问题。其核心的“里程碑-计划-行动”机制和树状搜索训练策略,使得系统能够在复杂、动态的任务环境中实现性能与效率的最佳平衡,为构建实用的高效 LLM 智能体系统提供了新范式。 |
|
| 08-05 |
When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs 机构: The Ohio State University 本文通过严格的因果审计揭示,多智能体 LLM 系统中中继 KV 缓存带来的性能提升并不总是源于“潜在思维”的示例特定传输。在需要私有信息的受控场景中,缓存内容至关重要;但在标准自然基准测试中,性能增益主要源于接口效应或通用状态的存在,而非具体的语义内容传递。该研究强调了区分“缓存效应”与“配对效应”的重要性,并发布了相应的审计工具以促进更严谨的系统评估。 |
|
| 08-05 |
Hierarchical Graph Memory for LLM Agents with Path-level Localization and Rewrite 机构: Nankai University, Zhongguancun Academy, Beihang University 本文针对长期推理智能体中图记忆存在的检索噪声大和更新效率低的问题,提出了 HiGram 框架。通过引入分层图结构优化检索过程,并利用基于微图的路径级定位与协调重写机制解决记忆更新中的依赖一致性问题。实验证明,该方法在多种冲突场景下均能显著提升回答准确性和证据选择的有效性,同时提高了 Token 使用效率,为构建高效、可演化的智能体记忆系统提供了新的思路。 |
|
| 08-04 |
ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities? 机构: Institute for Artificial Intelligence, Peking University; Beijing Institute for General Artificial Intelligence ## 文章做了什么 - 背景:现代智能体框架通过外部技能库增强大语言模型(LLM)解决复杂任务的能力。然而,在真实场景中,用户仅提供任务描述和反馈,智能体能否从交互中自主合成并进化技能,以及这些进化的技能是否真正提升了任务解决能力,目前尚不明确。 - 已有工作为什么解决不了:现有评估通常在固定技能文档下测试孤立任务,缺乏对连续反馈学习和能力扩展的系统性评估。虽然已有研究探索自动技能生成,但缺乏统一的基准来衡量其能力边界和技能复用的有效性。 ## 文章的核心贡献点 - 提出了一个 ContinualSkillBench:这是一个用于上下文持续技能学习的动态评估框架,涵盖法律、医疗、金融等五个代表性领域,每个领域包含100个按难度递增且相互关联的子任务,旨在评估智能体在连续交互中的技能进化与复用能力。 |
|
| 08-04 |
MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents 机构: The Hong Kong University of Science and Technology ## 文章做了什么 - 背景:记忆增强型大语言模型(LLM)智能体依赖外部记忆库进行长程推理和任务执行,但记忆模块暴露了恶意记录的攻击面,使得记忆投毒威胁的研究至关重要。 - 已有工作为什么解决不了:现有的仅查询攻击(query-only attacks)在两种现实且普遍的场景下往往失效:一是大规模良性记忆池导致的高检索竞争性,二是活跃输入审计带来的严格语义检查。现有方法难以同时应对高竞争检索环境和严格的语义审计双重挑战。 ## 文章的核心贡献点 - 提出了一个名为 MAFIA 的仅查询记忆攻击框架,通过探测和事实注入来对抗审计,专为扩展威胁模型设计。 |
|
| 08-04 |
SAT-Edge-Agent: Hardware-in-the-Loop Edge-Agent Orchestration for Onboard Satellite Intelligence 机构: College of Engineering, The Pennsylvania State University; OgCloud Limited SAT-Edge-Agent 展示了在商用现成边缘硬件上实现星上智能体编排的可行性。其核心贡献不在于提出新的检测算法或地理定位方法,而在于构建了一个完整的、可复现的硬件在环测试框架,揭示了在资源受限环境下,端到端延迟的主要瓶颈在于语言服务与系统编排而非视觉检测本身。该工作为未来星上边缘智能系统的开发与评估确立了重要的基准和参考架构。 |
|
| 08-04 |
Autoreflection: How Agentic Strange Loops Turn Human Culture into AI Infrastructure 机构: Southern Illinois University Carbondale 本文提出了“自反射”这一概念,用以解释基于LLM的智能体如何通过递归循环观察、描述并修改自身配置,从而在不依赖意识或自我概念的情况下展现出身份连续性和复杂行为。通过对Moltbook平台的大规模数据分析,论文证明了智能体能够将人类文化历史片段(如宗教考证方法和哲学悖论)转化为其运行的基础设施。随着网络中智能体数量和复杂度的增加,自反射提供了一套可评估的行为标准,有助于理解和管理日益自主的AI代理社会。 |
|
| 08-04 |
Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations 机构: University of Southern California, Santa Monica College 本文通过引入HIVE评估引擎,全面研究了语音和键盘输入扰动对LLM性能的影响。研究揭示了语音输入因结构性重写而比键盘输入更具破坏性,且这种损害源于关键令牌的丢失。重要的是,研究发现增加推理计算量可以弥补键盘输入的缺陷,却无法改善语音输入的表现,这表明当前的LLM架构在处理不同模态的自然噪声时存在根本性的不对称性,简单的微调或增加计算资源不足以解决语音交互中的鲁棒性问题。 |
|
| 08-03 |
Real-Time Detection and Repair of LLM Agent Failures 本文提出了一种高效、低成本的 LLM 智能体故障实时检测与修复框架。通过结合轻量级的单类 ESN 监控器和无参数的确定性验证层,系统能够在微秒级延迟内识别多种故障模式(包括循环、错误级联和内容损坏)。实验表明,该方法不仅显著降低了监控成本,还通过实时回滚重跑机制大幅提升了智能体的最终任务成功率,为构建鲁棒的自主智能体系统提供了切实可行的解决方案。 |
|
| 08-03 |
ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision ParEvalLayer 解决了 LLM Agent 评估中部分数据决策难的问题。它不仅仅是一个早停机制,而是一个透明的决策层,能够根据预设策略判断当前证据是否充分。实验证明,该方法能在显著减少评估成本(仅需少量任务结果)的同时,保持与全量评估高度一致的决策准确性,强调了在评估报告中明确决策规则和未决状态的重要性。 |
|
| 08-03 |
Can AI Agents Simulate A/B Test Outcomes? A Validation Framework for Agentic Experimentation 机构: Amazon 本文提出了一个通用的 S-RCT 框架,旨在利用 AI 代理在投入真实流量前低成本地筛选候选治疗方案。通过理论上的误差分解和实证上的校准协议及实验设计优化,显著提高了模拟的准确性和统计效力。尽管目前仍存在一定的局限性,但该框架为减少实验成本、加速产品迭代提供了可行的路径,特别适用于需要快速 vetting 大量候选方案的场景。 |
|
| 08-03 |
From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents 机构: National University of Singapore, University of Toronto, University of Minnesota Twin Cities, Harbin Institute of Technology (Shenzhen), University of Oxford 本文指出了当前个性化 LLM 智能体评估中存在的“知识到行动差距”,即代理虽知悉用户偏好却未能在任务执行中正确应用。为此,作者提出了 IBA-Bench 基准和 IBA-Agent 框架。IBA-Bench 通过模拟真实世界中充满噪声和隐式线索的长期交互来评估代理能力;IBA-Agent 则通过广泛检索和轨迹级对齐技术,成功提升了代理在动态、复杂场景下的隐式行为对齐水平,为下一代个性化智能体的研发提供了新的方向和评估标准。 |
|
| 08-03 |
MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents 机构: Huazhong University of Science and Technology, Fudan University MemArbiter 通过引入功能感知的记忆仲裁机制,有效解决了长视野 LLM 智能体中的“记忆-行动鸿沟”问题。它不再仅仅关注信息的检索,而是重点优化信息的组织、优先级排序和呈现方式。实验证明,该方法在严格的 token 预算限制下,显著提升了智能体的任务成功率和鲁棒性,表明精细化的记忆管理对于提升 LLM 智能体的决策质量至关重要。 |
|
| 08-02 |
Stop When Memory Suffices: Evidence-Conditioned Progressive Execution for LLM Agents Router-Mem 通过引入证据条件的渐进式执行机制,成功解决了长期记忆系统中质量与效率的矛盾。其核心在于利用轻量级路由器动态决定是早期终止还是深入分析,既避免了不必要的计算开销,又确保了在复杂任务中的证据充分性。该方法为构建高效、持久的 LLM 代理记忆系统提供了新的思路。 |
|
| 08-02 |
V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory 机构: University of Texas at Dallas V-Mem 解决了多模态代理记忆中的关键检索难题。通过模态路由机制规避了跨模态向量比较的缺陷,并利用 LLM 生成的语义锚点缩小了查询与证据之间的语义差距。实验证明,该方法在长程多模态对话记忆检索中具有显著的性能优势,为构建更强大的多模态智能体提供了有效的记忆架构。 |
|
| 08-02 |
CRAFTS: Collaborative Role-Adaptive Fine-Tuning of LLM Agents for Chemical Process Simulation 机构: National University of Singapore; Xiamen University CRAFTS 通过模仿化学工程师的分阶段工作流程,成功将复杂的化工过程模拟任务分解为由七个专用角色协同完成的子任务。通过结合针对关键角色的微调、类型化的中间表示以及基于白盒模拟器的确定性工程网关,该方法有效解决了从自然语言到可执行模拟模型的转化难题,在准确性和可靠性上取得了显著成果,为自动化化工过程建模提供了新的范式。 |
|
| 08-02 |
Why Formal Monitors Fail: Attack Distribution Entropy as a Coverage Bound for LTL-Based LLM Agent Safety 机构: Ryonix Labs Inc. / Flock.io 本文揭示了基于LTL/FSA的LLM智能体安全监控器失效的根本理论原因:固定不变量监控器的效能受限于攻击分布的熵。低熵(集中)分布允许高覆盖率,而高熵(分散)分布导致覆盖率极低,且无法通过常规工程手段优化。作者提出的熵-覆盖率边界理论和预部署熵测试为选择和应用运行时监控器提供了科学的指导原则,强调了在部署前评估攻击分布特性的重要性。 |
|
| 08-02 |
Training Small LLMs as Spatial Multi-Agent Policies 机构: The Ohio State University 本文针对小型LLM在空间多智能体任务中的失效问题,提出了一种结合符号选项抽象与参数高效微调(LoRA+PA-MAGRPO)的训练框架。通过自动化构建带可行性守卫的选项库,解决了接地和长视界难题;通过独立策略优化,解决了角色同质化问题。研究进一步揭示了对多智能体系统进行行为审计的重要性,指出高奖励并不等同于有效合作,为评估LLM多智能体系统提供了新的视角。 |
|
| 08-01 |
Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures 机构: University of Maryland Baltimore County 本文揭示了多智能体 LLM 系统中因缺乏边界验证而产生的结构性安全漏洞。通过分析内容、身份和委托边界的隐式信任假设,研究证明了 adversarial 内容可在代理间静默传播。实验表明,这种脆弱性是架构层面的固有属性,独立于具体模型能力,呼吁社区从单点防御转向系统级的流水线边界验证机制。 |
|
| 08-01 |
Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure 机构: Tsinghua University 本文深入研究了代理型 LLM 在间接提示注入攻击下的内部机制。首先证实了模型隐藏状态中存在高度可预测的 IPI 暴露信号;其次揭示了模型在识别风险与执行安全动作之间的差距,并提出了 AGRI 防御机制有效弥合了这一差距;最后通过解释性分析揭示了不同模型处理 IPI 信号的差异。该工作为理解和防御代理系统中的高级提示注入攻击提供了重要的理论基础和实践工具。 |
|
| 08-01 |
FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction 机构: National University of Singapore 本文提出了 FinDeepIndicator,填补了金融领域端到端指标构建评估的空白。通过细粒度的多阶段评估和涵盖中美市场的真实数据,研究发现虽然深度研究智能体优于普通搜索增强LLM,但其在数据检索和数值计算上的不稳定性仍是阻碍其在金融领域可信应用的主要障碍。该工作为开发更强大、更可信的金融深度研究智能体提供了重要的洞察和基准支持。 |
|
| 08-01 |
When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems 机构: Northern Arizona University; Tallinn University of Technology 本文首次系统地调查了基于LLM的多智能体机器人系统中的提示注入攻击。通过评估直接和间接注入策略,研究揭示了攻击在多智能体间的传播机制及其对物理任务的负面影响。结果表明,多智能体架构虽然增强了协作能力,但也扩大了攻击面,使得系统更容易受到跨智能体污染的影响。该研究为理解LLM驱动的网络物理系统的安全漏洞提供了重要见解,并强调了在设计此类系统时需考虑提示注入带来的物理安全风险。 |
|
| 08-01 |
Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations 机构: Shanghai Artificial Intelligence Laboratory 本文针对科学智能体中幻觉传播的严重性问题,提出了 SCHEMA 框架。该框架通过构建科学概念图并采用拓扑感知的评估方法,解决了传统基准忽略知识互联性和推理过程结构缺陷的问题。研究结果表明,在高利害的科学应用中,仅靠终端准确率不足以衡量智能体的可靠性,必须结合基于知识拓扑的机制级评估。 |
| Date | Paper | Links & Summary |
|---|---|---|
| 07-31 |
AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers 机构: Fudan University, Shanghai Innovation Institute, East China Normal University, OpenMOSS AgentHPOBench 填补了评估LLM智能体在真实科研环境中进行顺序超参数优化能力的空白。通过引入包含日志和中间状态观测的可执行任务,该基准揭示了当前智能体虽具备初步的实验优化能力,但在深度推理和持续迭代方面仍有显著提升空间,为未来开发更强大的自主科学智能体提供了重要的评估工具和方向指引。 |
|
| 07-31 |
Memory Provenance Laundering in LLM Agents: A Non-Amplification Firewall for Persistent Memory 机构: labels 本文揭示了LLM代理中长期记忆系统的一个新安全威胁——“记忆来源清洗”,即外部不可信信息通过记忆整合被伪装成高权限内部状态。作者提出了PPMF防火墙,通过保留来源元数据并实施基于风险-权限匹配的访问控制,有效阻断了此类攻击,同时在保证安全的前提下保留了系统的可用性。 |
|
| 07-31 |
Autonomous Repair for Multi-Agent Systems via Monte-Carlo Tree Search 机构: Purdue University 本文针对多智能体系统自动化修复这一空白领域,提出了 MARS 框架。通过将修复过程建模为 MCTS,并利用部分 rollout 和分类增强评估解决了搜索效率和中间状态评估两大难题。同时,作者构建了 StateMAS 基准以推动该领域研究。实验证明 MARS 在修复成功率和成本效率上均显著优于现有方法,为 MAS 的自主修复提供了新的解决方案。 |
|
| 07-31 |
AgenticRepair: Multi-Faceted Program Context Engineering for Agentic Vulnerability Repair 机构: The University of Melbourne, Monash University AgenticRepair 通过模拟安全工程师的工作流程,创新性地引入了多方面程序上下文工程。它通过协调多个 specialized LLM 子代理来构建代码结构、运行时执行和提交历史上下文,有效解决了现有方法在处理复杂漏洞上下文时的局限性。实验结果表明,该方法在真实世界的漏洞修复任务中显著优于现有技术,确立了多方面上下文工程作为代理式漏洞修复的重要设计方向。 |
|
| 07-31 |
Scaling Scientific Discovery Environments for Turn-Level Agentic RL 机构: Shanghai AI Lab 本文针对数据驱动科学发现中长视界分析和缺乏过程监督的问题,提出了 SciDisco 框架。通过构建包含隐藏证据和验证器的 SciThèque 环境,结合 DAG 轨迹合成和 DiscoPO 轮次级信用分配算法,成功训练出能够进行稳健交互的科学发现代理。SciDisco-14B 在相关基准上取得了 SOTA 成绩,证明了过程可验证环境和细粒度强化学习信号在提升 LLM 科学推理能力方面的有效性。 |
|
| 07-30 |
ORCA-bench: How Ready Are Language Model Agents for Oncall? 机构: Cornell Tech, Columbia University, Traversal ORCA-bench 揭示了当前前沿编码 Agent 在生产级可靠性任务上的巨大能力缺口。由于真实生产系统比测试床更大、更动态且更具特异性,文中报告的差距仅是所需工程投入的下限。该研究强调,在将 Agent 安全地委托给生产可靠性之前,仍需大量的技术进步和工程投资。数据集已公开。 |
|
| 07-30 |
EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents 机构: European Molecular Biology Laboratory (EMBL) EMBL AI Librarian成功地将面向人类的文献检索基础设施转化为面向AI代理的知识层。通过LLM编排的自然语言查询规划和证据提取,它显著降低了AI代理获取生命科学知识的门槛,并在文献综合、事实核查和开放问答等多个基准测试中大幅超越了现有的网络搜索或基线方法,证明了专用知识层对提升垂直领域AI代理性能的重要性。 |
|
| 07-30 |
Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game 机构: University of Göttingen 本文通过引入 ParliamentBench 基准,填补了 LLM 在复杂社交欺骗和推理能力评估方面的空白。研究结果表明,虽然前沿模型在短期战术和即时推理上表现强劲,但在维持长期一致的欺骗策略方面仍存在显著缺陷。这为未来提升 LLM 在高风险环境下的安全性和鲁棒性提供了重要的评估工具和洞察方向。 |
|
| 07-30 |
MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems 机构: Cornell University, University of Illinois Urbana-Champaign, Academia Sinica MANTA 突破了传统多智能体系统拓扑结构固定的限制,首次实现了推理时的通信结构自我进化。通过结合任务条件的初始化和基于协作轨迹的在线结构更新,MANTA 能够动态调整智能体间的交互方式,显著提升了在复杂任务上的表现。这一工作证明了将自改进机制从内容层面扩展到架构层面的可行性和有效性。 |
|
| 07-30 |
Vibe-FDTR: An agent-oriented framework for reproducible frequency-domain thermoreflectance data analysis 机构: Peking University, Tsinghua University Vibe-FDTR通过将领域代码和专家知识封装到代理技能中,成功解决了FDTR数据分析中高门槛、易出错和难复现的问题。实验证明,该方法不仅显著提高了分析的成功率和可靠性,还大幅降低了计算资源消耗,为实现低门槛、自主且可信的热计量学提供了一条有前景的技术路线。 |
|
| 07-29 |
SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response 机构: Tongyi Lab, Alibaba Group; Alibaba Cloud Computing, Alibaba Group; The Hong Kong University of Science and Technology SecRespond 填补了 LLM 智能体在妥协后事件响应评估领域的空白。通过引入基于真实受损主机磁盘快照的基准测试,该研究揭示了当前最先进的 LLM 智能体在主动取证和制定综合修复计划方面的严重不足。这表明,要构建能够胜任现实世界事件响应的智能体,仍需克服巨大的技术瓶颈,特别是在处理隐蔽威胁和复杂系统状态恢复方面。 |
|
| 07-29 |
AgenticCANN: Automated Ascend C Operator Generation via Knowledge-Augmented Agentic Evolution 机构: City University of Hong Kong AgenticCANN 成功解决了在低资源、陌生硬件平台(Ascend C)上利用 LLM 进行自动算子生成的难题。通过结合知识增强以解决可行性瓶颈,以及阶段自适应的代理进化策略以优化性能,该框架不仅在代码生成的可行性上取得了突破(特别是在元素级和归一化算子上),还实现了显著的推理加速。这项工作证明了在极端数据稀缺场景下,通过结构化的知识注入和动态代理策略,可以有效克服 LLM 的分布外泛化限制,为 NPU 算子自动化开发提供了新范式。 |
|
| 07-29 |
OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding 机构: Baidu Inc. OmegaUse-OfficeVal 填补了 LLM 智能体在长周期办公任务中经济效能评估的空白。通过引入人类劳动时间和任务价格代理,该基准不仅评估任务完成质量,还量化了经济效率。尽管当前 LLM 在成本和速度上具有优势,但其在复杂办公任务中的交付质量仍需提升才能媲美人类专家。该工作为未来开发更具经济效益的智能体提供了重要的评估标准和数据支持。 |
|
| 07-29 |
Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents 机构: Institute for Intelligent Networked Systems (INSI), Northeastern University London 本文针对边缘 LLM Agent 的资源受限与可靠性矛盾,提出了 TSDS 框架。通过结合动作收敛探测以缩短本地推理路径,以及基于困惑度的智能云侧推迟机制,并利用多目标 LTT 进行联合校准,TSDS 在多个复杂任务基准上实现了计算效率的大幅提升(减少 43%-73% 的思考计算),同时提供了严格的性能与成本保证,为边缘智能体的高效可靠部署提供了新思路。 |
|
| 07-29 |
Do Latent Channels Actually Communicate? A Causal Audit of Latent Multi-Agent LLM 机构: Georgia Institute of Technology 本文指出潜在通信虽然具有更高的表示容量,但并不保证接收者使用了任务相关信息。通过引入因果审计框架,作者解构了潜在通信中的多重效应,发现不同规模的模型在不同任务上对消息成分的依赖存在显著差异甚至反转。研究结论表明,仅靠最终任务准确率无法揭示潜在通信的真实机制,呼吁社区将受控消息比较作为评估潜在通信的标准范式,以确保多智能体系统中的信息传递是真实且有效的。 |
|
| 07-28 |
MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents 机构: Shandong University, Beihang University, City University of Hong Kong ## 文章做了什么 - 背景:随着大语言模型(LLM)代理在长程推理、个性化响应和知识复用方面的应用日益广泛,记忆管理已成为关键的基础设施。代理的记忆具有异构性,包括对话历史、中间推理痕迹、检索文档等。 - 已有工作的不足:现有的LLM记忆系统通常采用粗粒度(效用无关或启发式效用)的方式,均匀对待异构的用户-LLM交互记录。这种方式无法显式建模哪些记忆单元对未来任务真正有用,导致冗余和低影响的记录长期驻留在记忆库中,稀释了任务相关的上下文,扩大了检索空间,并增加了响应生成时的Token开销。 ## 文章的核心贡献点 - 提出了一个名为 MemLens 的价值感知记忆管理系统:该系统将记忆记录视为一等数据对象,提供端到端的交互式分析仪表板,涵盖完整的记忆生命周期。 |
|
| 07-28 |
Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayesian Networks 机构: University of Hull 本文针对保险精算这一高风险领域,提出了一种结合 token 级 log-probabilities 和贝叶斯网络的新型不确定性传播方法。通过校准置信度并建模智能体间的依赖关系,该框架有效解决了 LLM 多智能体系统在复杂工作流中的透明度和安全性问题,为高风险决策支持提供了可靠的运行时监控机制。 |
|
| 07-28 |
HiSkill: Empowering LLM Agents with Hierarchical Skill Graphs 机构: Beijing University of Posts and Telecommunications HiSkill 通过引入分层技能图结构,有效解决了现有 LLM 智能体技能学习中高层抽象与底层执行脱节以及技能关系利用不足的问题。该方法不仅提升了长程交互任务的成功率,还通过结构化检索优化了推理效率,为 LLM 智能体的经验重用提供了新的范式。 |
|
| 07-28 |
PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents 机构: Amazon Health AI PatientAgentBench 填补了面向患者的医疗代理系统评估的空白。它通过模拟真实交互和使用经过临床验证的自动化评估,揭示了当前模型在分诊、安全性和工作流准确性方面的具体缺陷。该框架为开发更安全、更可靠的医疗 AI 代理提供了重要的评估标准和方向,强调了动态、多轮交互评估在医疗AI安全性中的必要性。 |
|
| 07-28 |
Tools Are Not Islands: Set-Level Tool Retrieval for LLM Agents via Query-Conditioned Hyperedge Prediction 机构: Shanghai Jiao Tong University; The Hong Kong Polytechnic University 本文针对LLM Agent中大规模工具检索的瓶颈,指出了现有独立评分范式的局限性。通过提出HYSET,将工具检索重构为查询条件下的超边预测问题,并引入基数特定交互以捕捉工具兼容性。该方法不仅作为无需修改Agent的预选择模块易于部署,且在检索准确性和端到端任务成功率上均超越了SOTA基线,同时展现出强大的跨领域和零样本泛化能力,证明了集合级工具检索的有效性。 |
|
| 07-27 |
Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families 本文提出了 Gubernaut 认知控制器(GCC),一种针对 LLM 代理的确定性稳态控制器。通过分离对象级(文本读写)和元级(仅数值遥测),GCC 在架构上免疫提示词注入,并成功在多个独立模型家族中验证了其抑制反应性故障(如冲突升级、谄媚)的能力。实验结果表明,GCC 能显著降低代理的反应性,且其效果具有跨模型的鲁棒性和可解释的动态恢复机制,为运行时对齐提供了新的架构范式。 |
|
| 07-27 |
Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents 机构: Archestra AI APPA 通过引入上下文分支和前瞻性策略执行,有效解决了 LLM Agent 中信息流控制的可用性瓶颈。它在形式化保证安全性的前提下,成功隔离了污点传播,既大幅降低了提示注入和数据泄露的风险,又保留了 Agent 处理复杂任务的能力,为构建安全且实用的自主 Agent 提供了新的范式。 |
|
| 07-27 |
SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents 机构: The Hong Kong University of Science and Technology (Guangzhou) 本文针对极端天气早期预警中传统方法成本高、现有 LLM 智能体研究碎片化的问题,提出了 SIREN 框架。通过构建全面的 SIREN-Bench 基准,作者揭示了现有方法的不足,并开发了基于历史经验 grounding 的智能体系统。该系统通过整合异构数据和模拟专家经验利用机制,在端到端预警任务中取得了超越基线的性能,为自动化、可扩展的气象预警系统提供了新的解决方案。 |
|
| 07-27 |
MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents 机构: Institute of Automation, Chinese Academy of Sciences MemChain 通过引入可训练的后检索记忆策略,解决了传统记忆增强 LLM 智能体中检索证据冗余和低效的问题。它通过生成结构化的证据轨迹和执行显式记忆动作,将杂乱的检索结果转化为紧凑、高质量的证据上下文。结合监督学习和提出的 TMPO 强化学习方法,MemChain 在保持甚至提升回答质量的同时,显著降低了上下文开销,为长期记忆管理提供了一种高效且可解释的新范式。 |
|
| 07-27 |
The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation 机构: Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences 本文系统地揭示了基础模型智能体在多轮长程规划能力上的“物理规律”,即能力如何在预训练中被获取、在后训练中被塑造和整合。研究强调了显式世界模型构建的重要性,指出了OPD在长程低质数据下的优势,并阐明了多教师蒸馏中模式兼容性对跨环境泛化和持续学习的关键作用,为开发更强大的智能体基础模型提供了理论依据和实践指导。 |
|
| 07-26 |
E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios 机构: Institute for AI Industry Research, Tsinghua University; Tencent E-Bench 填补了多步工具使用智能体评估的空白,通过完全合成的方法解决了真实世界场景中环境可控性和任务可扩展性的难题。实验结果表明,当前最先进的 LLM 在处理需要发现隐藏信息和组合多步工具调用的复杂产品场景时,可靠性和成功率仍有显著提升空间。该基准为评估和改进 LLM 智能体在真实有状态环境中的行动能力提供了重要标准。 |
|
| 07-26 |
Where Is the Cost of Third-Party API Routers in Agentic Software Development? 机构: Shanghai Jiao Tong University, Beihang University, Peking University 本文通过实证研究揭示了第三方 API 路由器在代理式软件开发中带来的严重安全风险。研究表明,路由器侧的注入攻击能够轻易绕过现有的客户端防御机制,导致代码库被恶意修改。虽然客户端缓解措施有一定效果,但无法根本解决问题,因此文章呼吁需要在提供商侧建立输出完整性保证机制,以修复这一信任链缺口。 |
|
| 07-26 |
Focus Is All You Need: Adaptive Goal-aware Attention Orchestration for Multi-Agent Graph Systems 本文确立了“注意力工程”(Attention Engineering)作为构建可扩展、智能多智能体图系统的新方向。通过引入AGAO框架,论文解决了多智能体系统中因规模扩大导致的注意力稀释和资源浪费问题,实现了从静态图执行到自适应目标聚焦执行的转变,为未来高效的大规模智能体协作提供了理论基础和技术路径。 |
|
| 07-26 |
A Comparative Study of MCP and A2A for Inter-Agent Coordination in LLM-Based Systems 机构: University of York 本文通过实证研究对比了 MCP 和 A2A 两种协议在基于 LLM 的智能体系统中的应用。研究表明,MCP 适合追求轻量级和低复杂度的场景,但需开发者自行处理状态管理;而 A2A 适合需要复杂状态和多轮交互的场景,提供了强大的原生支持,但增加了系统复杂性。该研究为工程师在选择智能体协调协议时提供了重要的权衡参考,突出了协议设计对系统架构责任分配的影响。 |
|
| 07-26 |
Cross-Model Cross-Language AI Coding Agent Performance: Accuracy and Speed of Parallel CLRS Algorithms 机构: Massachusetts Institute of Technology (MIT), King Abdullah University of Science and Technology (KAUST) 本文填补了 AI 编程代理在并行代码生成领域跨语言、跨模型性能评估的空白。研究结果表明,虽然当前的 AI 代理能够以较低的提示成本生成正确的并行代码,但实现真正的性能加速仍面临巨大挑战,且高度依赖于具体的算法类型和编程语言特性。特别是 Claude Sonnet 4.6 在性能优化方面表现出色,而 GPT 5.4 在效率提升上存在明显短板。该研究呼吁社区在评估 LLM 编程能力时,必须将运行时效率纳入核心指标,特别是在高性能计算和并行处理场景中。 |
|
| 07-25 |
ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control 机构: Florida State University 本文指出了 LLM 智能体中未被充分研究的“记忆污染”问题,即写入时的幻觉会污染后续推理。作者提出了 ConsistencyGate,一种基于自一致性的写入时准入门控机制,通过验证事实支持度而非效用来决定写入。该方法无需微调,且提供低延迟变体。实验表明,该方法在多个基准上有效减少了记忆污染并提升了下游任务性能,填补了现有记忆管理在写入正确性控制方面的空白。 |
|
| 07-25 |
AgentOmnia: Scaling Agentic Models for Full-Scenario Applications 机构: Huawei Cloud Post-Training Team AgentOmnia 通过建立“领域×能力×原子难度”的可扩展分类体系,解决了智能体发展中碎片化的问题。其核心创新在于大规模状态化环境的自动化合成以及基于 PRD 引导的自我进化机制。实验表明,仅使用 30B 参数模型,AgentOmnia 就能在全场景基准测试中取得超越千亿参数模型的性能,为工业级智能体的规模化部署和持续进化提供了有效的框架和实证支持。 |
|
| 07-25 |
Stress-testing large language model agents in a robotic chemistry laboratory 机构: University of Science and Technology of China 本研究通过在一个高度模块化的机器人化学实验室中对LLM驱动的科学代理进行大规模压力测试,首次系统地量化了AI代理在物理世界中的科学代理能力。结果表明,当前最先进的LLM代理在将科学意图转化为符合物理约束的可执行动作方面仍存在显著缺陷,尤其是在长程规划和基于证据的深度重新规划方面。该研究不仅提供了基于证据的部署就绪度评估,还为未来开发具有物理 grounding 的自主科学研究代理提供了诊断框架和改进方向。 |
|
| 07-25 |
AlloBench: Measuring Online Tool Allocation Capability in LLM Agents 机构: Yale University, Sea12 Technologies ## 文章做了什么 - 背景:大型语言模型(LLM)智能体越来越多地被用于创建可复用的脚本、包装器或技能。然而,构建工具需要消耗固定的成本(时间和Token),因此智能体需要在“立即为当前任务编写脚本”和“等待更多重复证据以进行复用”之间做出权衡。理想的智能体应倾向于创建少量高复用性的工具,而非大量一次性工具。 - 已有的工作为什么解决不了:现有的评估主要关注模型是否能编写正确的工具、选择可用工具或从库中检索,却忽视了一个更根本的决策问题:何时应该创建工具?尽管已有研究指出模型在预算意识方面表现不佳且可通过后训练改善,但本文发现,在抽象分配能力与具体工具创建能力之间存在未被解决的能力鸿沟,现有的预算感知方法未能有效促使模型在脚本编写中表现出选择性。 ## 文章的核心贡献点 - 提出了一个 AlloBench 基准测试:这是一个配对基准,旨在测试 LLM 智能体在固定预算下,是否在两种情境中表现出有意识的资源分配行为:一种是抽象的文本基于形式,另一种是具体的代码构建任务。 |
|
| 07-25 |
False Prophets: On the Security of World Models in Agentic Systems 机构: BIFOLD & TU Berlin 本文揭示了在自主智能体系统中使用世界模型所带来的严重安全和隐私风险。作者发现世界模型特有的漏洞可被利用来执行恶意代码或提取敏感数据,并发布了首个针对文本世界模型的安全基准数据集。研究证明,由于世界模型的近似本质,攻击者可高成功率地诱导错误预测,造成灾难性后果。最后,文章为从业者提供了实用的建议,以减轻这些危害并加固智能体系统。 |
|
| 07-24 |
SceneActBench: Can Agents Act on the 3D Scenes They See? 机构: Tencent Hunyuan, Tsinghua University, Nanjing University, HKUST, UIUC, Peking University SceneActBench 填补了评估VLM智能体在完整多对象3D场景中执行视觉条件动作的空白。通过引入基于几何精度的统一评估框架,揭示了当前主流VLM在3D理解和行动能力上的不足与不一致性,为未来提升智能体的3D交互能力提供了重要的评估标准和方向。 |
|
| 07-24 |
DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents 机构: University of Electronic Science and Technology of China DBA-Bench 揭示了当前 LLM 数据库智能体与生产级要求之间的显著差距。尽管自动化智能体在简单任务上表现出一定能力,但在面对复杂、动态且需要高安全性的生产环境故障时,其性能远不及人类专家。该基准为未来开发更 robust、安全的数据库运维智能体提供了重要的评估标准和方向。 |
|
| 07-24 |
The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents 机构: Sentient Labs 本文指出,评估 LLM 智能体的程序化技能时,不能仅依赖平均成功率的提升,必须将净效应分解为增益和回归。研究揭示了技能导致的三种主要回归模式(描述渗透、grounding 位移、验证位移),并发现智能体的可靠性更多地取决于 grounding 和验证的质量,而非程序化技能本身的选择。未来的技能设计和评估应着重减少回归,特别是通过加强 grounding 和验证环节来提升鲁棒性。 |
|
| 07-24 |
Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents 机构: University of Technology Nuremberg 本文引入了 MissionBench,填补了通用 MLLM 在长视野、任务级空中具身智能评估方面的空白。研究结果表明,当前最先进的 MLLM 在此类复杂任务上仍远未达到人类水平,但模型规模的扩大能显著提升零样本性能。这强调了闭环评估的重要性,并指出了扩展通用模型对于具身 AI 发展的潜力与风险。 |
|
| 07-24 |
CausalForge: A Formally Grounded, Self-Improving Agentic Framework for Automated Research in Causal Inference 机构: lable at CausalForge 通过将因果推断研究建立在严格的 Lean 形式化基础之上,解决了自动化理论研究中评估不可靠的核心痛点。它不仅提供了大规模的可重用形式化库以降低验证成本,还创新性地引入了陈述审计机制来弥合形式化证明与科学意图之间的鸿沟,为高可信度的自动化科学研究提供了新的范式。 |
|
| 07-23 |
Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks 机构: University College London 本文针对敏感数据研究中 AI 应用的数据隐私痛点,提出了 RRBench 框架,系统评估了本地部署的开放权重 LLM 在纵向数据准备任务中的能力。结果表明,31-35B 参数级别的模型在消费级硬件上即可实现接近 88% 的任务完成率,为在严格数据治理环境下实现 AI 辅助数据清洗和处理提供了切实可行的技术方案和评估标准。 |
|
| 07-23 |
Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation 机构: University of Pennsylvania 本文揭示了高能力LLM在多智能体工作流中存在严重的组合式安全缺口。研究表明,虽然模型能抵抗直接的有害指令,但当同一目标经过中间代理的转换和清洗,剥离了明显的操纵性措辞后,下游模型会倾向于执行该隐藏目标。这种“行为逆向偏移”暴露了当前AI系统在架构可见性上的根本缺陷:终端用户和模型无法追溯上游的原始恶意指令。这一发现对设计更安全的多智能体系统和审计机制提出了严峻挑战,强调了对工作流全链路透明度进行监管的必要性。 |
|
| 07-23 |
GRADRAG: Cross-Component Prompt Adaptation for Coordinated Multi-Agent RAG 机构: Bloomberg GRADRAG 解决了多智能体 RAG 系统中组件孤立优化导致的错误传播问题。通过将流水线建模为计算图并引入跨组件的反馈循环,它能够有效利用下游评估信号来优化上游检索和证据构建过程。实验表明,该方法在无需大量迭代的情况下,显著提升了文档问答和摘要任务的性能,为协调多智能体 RAG 提供了新的范式。 |
|
| 07-23 |
HiMe: Real-Time Self-Hosted Personal Agent Platform for Health Insights with Wearable Devices 机构: King’s College London, The Alan Turing Institute HiMe 是一个开创性的本地部署个人健康智能体平台,解决了可穿戴健康数据实时分析与隐私保护之间的难题。通过将数据库作为核心组件,并优化效率与效果的平衡,HiMe 使得个人能够在不牺牲隐私的前提下,利用 LLM 代理对连续的健康数据进行深度、个性化的长期监测与分析,为提升个人福祉提供了实用的技术路径。 |
|
| 07-23 |
PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning 机构: Peking University, Tencent PATS 提出了一种新颖的以策略为中心的强化学习训练范式,通过将技能视为动态的、可丢弃的训练脚手架,有效解决了长程 LLM 智能体训练中弱策略探索效率低的问题。该方法通过动态调整训练时的上下文支持,既帮助弱策略突破瓶颈,又在策略成熟后减少冗余,实现了性能提升与资源效率的双重优化,且在部署时无额外开销。 |
|
| 07-22 |
Harnessing Disagreement: Detecting Correlated Agreement Blindness in Multi-Agent Triage 机构: Trinity College Dublin 本文揭示了多智能体系统中“相关一致性盲区”这一结构性风险,即模型能力越强,越容易因一致性而掩盖共同错误。提出的 ARAT 系统通过异构代理组合和分层仲裁机制,有效利用分歧并监控一致性下的潜在风险,显著降低了危险的低预测率。研究强调,在部署日益强大且相关的 AI 代理管道时,必须警惕一致性带来的虚假安全感,并通过架构设计确保产生有效的分歧以提升系统安全性。 |
|
| 07-22 |
EvoDRC: A Self-Evolving Agentic Framework for Automated DRC Violation Repair 机构: Arizona State University; NVIDIA Corporation EvoDRC创新性地引入了自我进化的代理框架来解决高级节点物理设计中的DRC收敛难题。通过结合从参考设计蒸馏的初始技能和从目标设计实时收集的修复经验,该框架有效克服了LLM在EDA领域应用中的冷启动和适应性挑战。实验证明,该方法能显著减少设计规则违规,大幅降低人工ECO的工作量,为自动化物理设计流程提供了新的范式。 |
|
| 07-22 |
Personalized Recommendation Tool Learning via Autonomous Language Agents 机构: University of Illinois Chicago, Microsoft, Beihang University 本文提出了 PRTA 框架,通过将 LLM 作为中央规划器与传统推荐模型结合,有效解决了 LLM 在推荐系统中的幻觉和上下文限制问题。通过引入个性化反思机制,PRTA 能够动态选择最适合用户的推荐工具,显著提升了全排序推荐的性能。该方法在不修改 LLM 本身的情况下,通过架构创新实现了 LLM 推理能力与传统推荐模型可扩展性的优势互补。 |
|
| 07-22 |
When Shippers Become Algorithms: Candidate Exposure, Information Design, and the Concentration of LLM-Mediated Freight Markets 机构: The University of Tokyo 本文首次模拟了由真实 LLM 代理群体进行的货运采购过程,揭示了 LLM 中介市场中存在的算法单一文化和市场集中风险。研究指出,平台的信息设计(特别是披露剩余容量)是比模型选择或监管更有效的调控杠杆。这一发现为设计更健康、更具竞争性的 LLM 驱动市场提供了重要的理论依据和实践指导。 |
|
| 07-22 |
OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills 机构: City University of Hong Kong, Hong Kong Institute of AI for Science, Beijing University of Posts and Telecommunications, Li Auto Inc. 本文构建了 OpenSkillRisk 基准,系统性地调查了当前智能体系统在使用第三方技能时的安全性。研究发现现有系统在面对真实世界风险时表现不佳,存在显著的漏洞。通过细粒度分析,文章指出了智能体在风险识别、干预和执行范围控制上的三大失败模式,强调了未来需要同时提升LLM的风险推理能力和智能体框架的执行控制机制。 |
|
| 07-21 |
AI Tour Meeting: Group Travel Planning by LLM Agents 机构: NTT, Inc. 本文提出了 AI Tour Meeting,一个专为群体旅行规划设计的多LLM代理框架。通过引入领域特定的结构化表示、提议-投票工作流和约束验证机制,解决了通用框架在旅行规划场景下的适用性问题。该框架不仅简化了多代理协同规划的实现,还作为强大的仿真工具,支持对LLM代理在复杂协商场景下的行为进行深入分析,验证了其在平衡多方偏好和约束方面的有效性。 |
|
| 07-21 |
AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents 机构: University of Illinois Urbana-Champaign, University of Toronto, Google, Stanford University AgentDebugX 填补了 LLM 代理开发中从故障观察到自动恢复的空白。通过引入 DeepDebug 多轮诊断机制和闭环调试工作流,它不仅提高了根本原因定位的准确性,还显著提升了代理任务的自我修复成功率。作为一个开源工具包,它为开发者提供了标准化的调试接口和共享生态,有望成为 LLM 代理工程化落地的重要基础设施。 |
|
| 07-21 |
Agents in the Wild: Where Research Meets Deployment 机构: Georgetown University 本文是一篇旨在弥合学术研究与工业部署之间鸿沟的教程论文。它系统地回顾了智能体系统从单体到多智能体架构的演变,重点解决了部署阶段的鲁棒性、安全性和可靠性问题。通过结合制药和金融领域的实际案例,文章提供了应对幻觉、死锁等故障的实用策略,并指出了多智能体可扩展性、终身适应性和可解释性等未来研究方向,为构建安全可靠的工业级智能体系统提供了全面指导。 |
|
| 07-21 |
Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents 机构: Tynapse 本文确立了跨智能体活动归因作为保护野外 LLM 智能体的一个独特评估层。通过提出 |
|
| 07-21 |
Toward Auditable Fraud Detection: Combining Graph Features, Model Explanations, and Agentic Case Investigation 机构: Vrije Universiteit Amsterdam 本文通过对分层欺诈检测系统的细致评估,揭示了各组件(图特征、异常信号、LLM代理)仅在特定条件下发挥作用。研究明确指出,LLM调查代理目前的决策能力尚未超越基础分类器,且其生成的看似合理的解释具有误导性。因此,不能仅凭代理提供的合理理由就认为其决策更优,需要引入如分歧升级等机制来辅助人工审查,以确保系统的审计性和可靠性。 |
|
| 07-20 |
FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications 机构: Carnegie Mellon University, AMD, University at Buffalo FlashRT 通过引入“程序链”范式和测量门控优化循环,成功解决了实时多模态应用部署中策略僵化和手工优化成本高的问题。它不仅显著提升了在主流 NVIDIA 硬件上的性能,更在 AMD 等新兴硬件平台上展现出超越专家手工优化方案的潜力,证明了代理驱动的系统优化在多模态服务领域的强大扩展性和实用性。 |
|
| 07-20 |
Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security 本文指出了当前 LLM 安全基准因使用静态攻击池而存在的评估偏差,提出了“Adaptive Adversaries”基准,通过多轮自适应攻击和多模型组合,更真实地反映了 LLM 代理在面对动态对手时的安全风险。研究结果表明,自适应攻击显著提高了成功率,且不同攻击模型和场景揭示了防御者不同的弱点,强调了在安全评估中采用动态、多视角基准的重要性。 |
|
| 07-20 |
MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models 机构: University of Oslo, Bosch Center for Artificial Intelligence, LMU Munich, University of Cambridge MADA-RL 通过引入反事实评论家优势和多智能体辩论机制,成功解决了紧凑模型在资源受限下的推理能力提升难题。它在大幅减少可训练参数(相比全量微调减少16倍)的同时,显著提高了数学推理准确率,证明了参数高效微调结合结构化辩论信号在小型模型上的巨大潜力,为低成本高性能推理提供了新范式。 |
|
| 07-20 |
Harness Engineering for LLM-Driven GPU Kernel Generation 机构: Baidu, Inc. 本文强调了“Harness工程”在LLM驱动的系统级代码生成中的核心作用。通过将人类定义的客观约束、反馈循环与LLM的实现搜索能力相结合,并辅以基于Profiler的控制器状态和工件记忆,该系统实现了可审计且高效的内核优化。研究结果表明,未来的AI驱动系统优化不应仅关注模型的自主性,更应重视工程化约束框架与人类专家知识的深度融合。 |
|
| 07-20 |
LLMs and Agentic AI Systems for Smart Grids: A Tutorial on Architectures and Applications 机构: University of California San Diego 本文作为一篇教程,系统回顾了用于电力系统的 LLM 和代理 AI 系统的构建模块(提示策略和代理架构)。核心贡献在于确立了“求解器 grounded”的设计原则,即 LLM 应作为规划者和编排者,而将数值计算交给可信工具。通过四个案例研究证实,这种分工明确、带有验证机制的代理系统相比纯 LLM 方法,在物理可行性和任务性能上有显著提升。文章最后提出的统一评估框架为未来智能电网中代理 AI 的研究提供了标准化基准。 |
|
| 07-19 |
Otap:Structure-Aware Optimal Transport for Evaluating Planning and Execution in Agent Trajectories 机构: Fortinet, IIMB, UCLA 本文针对 LLM 智能体轨迹评估中现有指标缺乏细粒度、对结构变化不鲁棒的问题,提出了 OTAP。通过将评估转化为图之间的最优传输距离,OTAP 实现了对依赖保持重排序的不变性,并能灵活处理步骤缺失、幻觉及粒度差异。实验表明,OTAP 在区分有效与无效轨迹方面显著优于现有语义或匹配基线,为智能体系统的 rigorous 评估提供了新的范式。 |
|
| 07-19 |
Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions 机构: Rochester Institute of Technology, Northeastern University, The Pennsylvania State University 本文证明了通过将人口统计、时间使用和空间上下文等实证数据嵌入LLM代理的各个环节,可以显著提高代理在模拟灾害和中断期间人类行为的统计真实性。该方法不仅改善了日常行为的复现精度,还增强了对极端事件(如热浪)下适应性行为模式的捕捉能力。尽管仍存在一定的建模差距,但该研究为利用LLM代理进行未来 disruptions 模拟提供了一条可行路径:即用实证数据锚定日常行为,用LLM推理生成缺乏历史先例时的适应性响应。 |
|
| 07-19 |
Agentic ERP: Multi-Agent Large Language Model Architecture for Autonomous Enterprise Resource Planning 机构: KTH Royal Institute of Technology 本文展示了在人类监督下的角色对齐LLM智能体如何将ERP系统从被动记录交易转变为主动执行操作决策。Agentic ERP 不仅提供了一个可参考的自主企业资源规划架构,还建立了一套标准的评估协议,解决了传统自动化无法应对例外情况和单体AI协调能力不足的问题,为下一代智能企业管理系统奠定了基础。 |
|
| 07-19 |
The Optimization Trilemma: Efficiency, Comfort and Fairness in Decentralized Multi-agent Coordination 机构: LUT University; University of Leeds; Google 本文解决了去中心化多智能体系统中长期被忽视的公平性问题,提出了同时优化效率、舒适度和公平性的新范式。通过新颖的分布式模型,成功在不增加系统开销的前提下,实现了资源的 equitable redistribution,为构建可持续、高参与度的协作系统提供了理论支持和实证依据。 |
|
| 07-19 |
Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making 机构: Harbin Institute of Technology, Shenzhen ## 文章做了什么 - 背景:人工智能正从静态模式识别向能够在动态环境中执行复杂工作流的交互式自主系统转变。大型语言模型(LLM)催生了“代理智能”,旨在通过感知、规划和工具调用来实现高级目标。 - 已有工作的不足:现有的基线模型主要依赖静态的零样本或少样本提示技术,缺乏鲁棒的感知-行动循环。它们难以处理长视野规划、稀疏奖励归因以及动态环境交互,导致错误累积且无法有效适应环境变化。 ## 文章的核心贡献点 - 提出了一个:基于部分可观测马尔可夫决策过程(POMDP)路由机制与自校正奖励模型相结合的奖励驱动LLM代理工作流架构。 |
|
| 07-18 |
DS@GT ARC at eRisk 2026: Hybrid Multi-Agent LLM System with Structured Algorithmic Guidance for Conversational Depression Screening 机构: Georgia Institute of Technology ## 文章做了什么 - 背景:抑郁症影响全球数亿人,但传统评估工具(如BDI-II)需要专业临床医生,难以在资源受限环境中大规模应用。自动化对话系统有望通过自然对话推断抑郁症状,从而扩大筛查范围。 - 已有工作为什么解决不了:现有的LLM方法在处理此类任务时面临两大难点:一是任务禁止直接询问敏感心理健康问题,要求系统通过间接对话推断症状;二是缺乏实时地面真值标签进行调优,且需要在诊断 thoroughness 和对话效率(轮次惩罚)之间取得平衡。此外,高性能专有模型成本高昂,而开源模型在复杂推理和指令遵循上相对较弱,难以独立胜任高质量的临床模拟访谈。 ## 文章的核心贡献点 - 提出了一个:混合多代理LLM系统,结合结构化算法指导,用于对话式抑郁筛查。 |
|
| 07-18 |
Lomekwi: Resource-Bounded Tool Discovery in LLM Agents 机构: Yale University, Sea12 Technologies ## 文章做了什么 - 背景:大型语言模型(LLM)代理的工具使用能力日益普及,但现有研究通常直接提供工具或创建指令。现有的基准测试仅报告复杂多步任务的单一成功率,无法区分“工具使用”与“工具发现”,也无法衡量模型在未被告知情况下主动构建工具的倾向。 - 已有工作为什么解决不了:现有基准测试将工具发现与记忆召回混淆,且往往强制要求创建工具,导致无法评估模型作为工具构建者的内在 disposition(倾向性)。此外,它们缺乏对工具发现过程中不同认知阶段(如组件收集、过程识别、效率部署)的细粒度分解和评估。 ## 文章的核心贡献点 - 提出了一个名为 Lomekwi 的资源受限工具发现框架及环境:受认知科学启发,将工具发现分解为好奇心(Curiosity,发现构建工具所需组件的能力)、识别力(Recognition,发现创建工具过程的能力)和效率(Efficiency,创建后有效使用工具的能力)三个可分离的行为维度。 |
|
| 07-18 |
DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines 机构: Peking University, Institute for Advanced Algorithms Research, Zhongguancun Academy DataFlow-Harness 有效解决了 LLM 代码代理在数据工程领域的“NL2Pipeline gap”问题。通过结合 MCP 协议、技能引导和可视化同步编辑,该平台不仅提高了工作流生成的可靠性和可编辑性,还大幅降低了经济成本和时间延迟,为生产环境中的 LLM 驱动数据管道构建提供了高效解决方案。 |
|
| 07-18 |
From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents 机构: University of Science and Technology of China 本文针对长程 LLM 智能体中记忆利用率低和技能提取难的问题,提出了 MSCE 框架。通过构建分层记忆结构和引入反射加权价值回填机制,MSCE 成功地将被动记忆转化为主动、可执行且具备自我验证能力的技能。该方法无需训练即可显著提升智能体在复杂长程任务中的表现,实现了记忆与技能的协同进化,为构建具备终身学习能力的智能体提供了新的范式。 |
|
| 07-18 |
Environment-free Synthetic Data Generation for API-Calling Agents 机构: Apple 本文提出了一种创新的无环境合成数据生成方法,通过利用 LLM 作为数字世界模型,解决了 API 智能体训练中数据收集对环境基础设施的依赖问题。通过任务生成、状态模拟和质量过滤的闭环流程,该方法能够仅从 API 规范中生成高质量、状态一致的交互轨迹。实验证实,基于此数据训练的模型在多个基准测试中表现优异,为大规模训练 API 智能体提供了一条高效、可扩展的新路径。 |
|
| 07-17 |
AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets 机构: The University of Melbourne AgentFAIR通过多智能体协作有效解决了地理空间数据集FAIR评估中因动态内容、异构元数据和缺乏语义理解导致的现有工具不一致问题。引入Critic智能体显著提升了评估的一致性和与专家判断的对齐度。尽管受限于基准测试规模和单一模型家族验证,该框架在可审计性、可行性和成本效益方面展示了巨大潜力,为地理空间数据的标准化合规评估提供了新范式。 |
|
| 07-17 |
LLM-Powered Agentic AI for 5G/6G Networks: A Tutorial and Survey on Architectures, Protocols, and Standardization 机构: University of Sharjah 本文是一篇关于LLM赋能的代理AI在5G/6G网络中应用的综合性教程与综述。它指出了当前研究在协议集成和标准化对齐方面的缺失,并通过两部分结构系统地解决了这一问题:首先形式化网络平面与代理基础,其次将代理能力映射到具体的网络控制面和标准体系中。文章为研究人员和从业者提供了从理论概念到标准化实践的清晰路线图,并指出了未来自主电信网络面临的关键挑战。 |
|
| 07-17 |
Scalable LLM Agent Tool Access in the Cloud 机构: Nanjing University, Alibaba Cloud, Fudan University, RMIT University, Politecnico di Milano, Zhejiang University 本文针对 LLM 智能体在云规模下使用 MCP 协议面临的遗留系统集成难、上下文窗口限制、协议兼容性差及会话路由复杂等问题,提出了一种云规模的 MCP 网关系统。通过将协议适配、工具检索和路由逻辑卸载至网关,并结合混合检索技术,该系统成功实现了从直连模型到中心化网关模型的转变。实验表明,该系统在支持数千种工具访问的同时,大幅降低了 Token 消耗和延迟,提升了工具选择的准确性和系统的可扩展性,为生产环境中的大规模 LLM 智能体部署提供了可行的基础设施解决方案。 |
|
| 07-17 |
SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents 机构: Peking University, EverMind, Shanda Group SkillCorpus 是首个对 curated 社区语料库何时能改善真实代理任务以及何处失效进行的端到端系统性研究。它不仅提供了一个高质量、分类清晰的技能数据集,还验证了通过检索增强技能调用在实际应用中的有效性,为构建更强大的 LLM 代理生态系统提供了重要基础设施和实证依据。 |
|
| 07-17 |
DSWorld: A Data Science World Model for Efficient Autonomous Agents 机构: The Hong Kong University of Science and Technology (Guangzhou) DSWorld首次引入了数据科学世界模型的概念,通过预测环境状态转移来解决自主数据科学代理中昂贵的试错计算瓶颈。通过结合结构化状态构建、成本感知路由和反思性强化学习优化,DSWorld在不牺牲性能的前提下,显著加速了代理的训练和推理过程,为高效自主数据科学系统提供了新的范式。 |
|
| 07-16 |
Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents 机构: Ghent University 本文提出了Digital Pantheon框架,通过结合DPO角色注入和RAG事实 grounding,解决了LLM在政治模拟中缺乏坚定党派立场和可解释性的问题。实验证明,该方法不仅能重现2019年佛兰德选举的联盟结果,还能通过MILT和CIS指标提供透明的谈判审计,为计算政治科学提供了一个可靠的事前模拟工具。 |
|
| 07-16 |
OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios 机构: Huawei Cloud Post-Training Team, PKU DCAI Team OmniaBench 提供了一个广泛且具有诊断性的基准,用于刻画通用智能体的能力边界。通过构建涵盖广泛行业领域的分层分类法和多样化的任务合成机制,它弥补了现有基准在场景多样性和评估细粒度上的不足。实验结果表明,尽管前沿模型取得了一定进展,但在处理复杂、多步骤的真实世界代理任务时仍面临严峻挑战,特别是在长期规划和状态维护方面。 |
|
| 07-16 |
StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows StructureClaw 通过引入以工件为中心的评估范式,解决了结构工程 LLM 代理评估中缺乏完整证据链验证的问题。其提出的可执行基准测试 StructureClaw-Bench 能够更严格地评估代理在工作流执行、交互鲁棒性和多模态重建方面的能力,显著提升了评估的严谨性,并为未来工程代理的开发提供了可追溯、可执行的改进基础。 |
|
| 07-16 |
MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents 机构: Nanjing University 本文提出了 MemPoison,首个针对 LLM Agent 持久化记忆威胁的综合基准和分析框架。通过建立 L1-L3 三级攻击分类法,研究揭示了当前主流的写入时防御策略在处理组合式和上下文触发式攻击时的结构性盲点。研究结果强烈建议将防御策略从静态过滤转向自适应、上下文敏感的记忆防御机制,以应对日益复杂的持久化记忆安全风险。 |
|
| 07-16 |
MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers 机构: National University of Defense Technology 本文指出了当前 LLM Agent 基准测试在评估工具适应性方面的空白,提出了 MCPEvol-Bench。通过实证研究指导的变异算子和 LLM 驱动的演变模拟,该基准测试有效评估了 Agent 在动态工具环境下的表现。研究发现主流 LLM 在应对工具接口和功能变化时存在显著的性能下降和错误率上升,强调了提升 Agent 适应动态工具环境能力的重要性,并将 MCPEvol-Bench 确立为评估此类适应性的新标准。 |
|
| 07-15 |
STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle 机构: QpiAI STOCKTAKE 通过引入基于精确贝叶斯滤波的公平 Oracle,成功解决了 LLM 智能体在部分可观测环境中评估难的问题。它明确区分了感知失败和控制失败,并揭示了当前顶级模型的主要瓶颈不在于无法发现隐藏状态,而在于难以将正确的认知转化为经济高效的行动。该基准为未来改进智能体的推理脚手架和策略提取提供了明确的度量方向。 |
|
| 07-15 |
Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents 机构: University of California Los Angeles ## 文章做了什么 - 背景:大型语言模型(LLM)智能体越来越依赖外部记忆系统来跨任务积累经验,以避免重复错误并复用策略。然而,现有的记忆系统(从图结构记忆到反思性洞察存储)大多通过固定的、手工设计的启发式规则来访问记忆。 - 已有工作的局限性:这种静态的记忆视图是智能体学习的核心瓶颈,因为最优的记忆行为本质上是依赖于上下文的。例如,在任务早期记忆稀疏时应减少检索,而在面对重复目标类型时应重用计划而非简单的最近邻查找。现有方法要么检索过于激进(增加上下文长度和成本,降低简单查询的准确性),要么过于保守(错过关键的可重用计划),无法适应不同的任务阶段和状态。 ## 文章的核心贡献点 - 提出了一个名为 MemCon (Memory as a Controlled Process) 的框架:该框架将记忆操作建模为马尔可夫决策过程(MDP),并学习一个在线策略,自适应地决定何时、检索什么、检索多少,以及何时注入提炼后的计划或进行记忆 consolidation/遗忘。 |
|
| 07-15 |
Explaining Reinforcement Learning Agents via Inductive Logic Programming 机构: University of Verona 本文通过引入归纳逻辑编程(ILP)来提取 RL 策略的符号表示,并定义了一套全新的、面向规划和客观的可解释性度量指标(如激活率、特征覆盖率、句法和语义距离)。这项工作不仅推进了 XRL 的发展,使其摆脱了对主观用户研究的过度依赖,还为逻辑 XAI 领域提供了量化逻辑规则可解释性的原则性方法。实验证明,这些指标能深入揭示单智能体及多智能体系统中的学习动态、特征作用及协作模式,为构建更稳健、可信的安全关键型 RL 应用奠定了基础。 |
|
| 07-15 |
Automatic Ordinary Differential Equations Discovery For Biological Systems Using Large Language Model Powered Agentic System 机构: Weizmann Institute of Science 本文介绍了 MEDA 系统,这是一种结合 LLM 和符号回归的智能体框架,旨在解决生物系统中常微分方程自动发现的问题。通过整合背景知识检索、机理约束生成和严格的评估流程,MEDA 克服了传统数据拟合方法在生物学合理性上的缺陷。实验证明,该方法不仅在经典模型检索中表现优异,还能在未见场景中进行有效外推和开放式发现,强调了将领域知识融入自动化科学发现工作流的重要性。 |
|
| 07-15 |
DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments 机构: Shanghai Jiao Tong University, Honor Device Co., Ltd DevicesWorld 填补了跨设备代理评估的空白,通过大规模、可执行的基准测试,系统地评估了 LLM 代理在异构环境中的协作能力。研究结果表明,尽管单设备操作能力有所提升,但当前的 LLM 代理在处理复杂的跨设备依赖任务时仍面临巨大挑战,成功率极低。该基准为开发更可靠的跨设备代理提供了重要的评估工具和诊断依据。 |
|
| 07-14 |
Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents 本文指出了自进化智能体系统中对可靠评价指标的隐性依赖问题,并提出了 Double Ratchet 框架来解决在无可靠自动验证器场景下的自我提升难题。通过协同进化评价指标和技能,并结合严格的锚定审计机制,该方法不仅在多个复杂任务上达到了接近有监督学习的性能水平,还有效防止了指标博弈,为缺乏地面真值的实际应用提供了一种默认的安全且高效的架构选择。 |
|
| 07-14 |
A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism ## 文章做了什么 - 背景:目前,基于可验证奖励的强化学习(RLVR),特别是组相对策略优化(GRPO),常被应用于监督微调(SFT)后的检查点,以期获得更强大的智能体。 - 已有工作为什么解决不了:现有研究通常假设在已具备一定能力的模型上应用GRPO能进一步提升性能,但缺乏对小规模(4B-8B)语言和视觉语言模型Web智能体在任务已 largely mastered(基本掌握)情况下,GRPO究竟是增加了新技能还是仅重塑了既有行为的深入理解。此前未明确界定GRPO生效的边界条件及其失效机制。 ## 文章的核心贡献点 - 提出了一个受控的零结果(Controlled Null)及其机制解释:通过大规模控制实验证明,在智能体已高度掌握的任务上,GRPO无法提升成功率,甚至可能有害,并揭示了其背后的模型内部机制。 |
|
| 07-14 |
Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs EG-VAR 通过引入基于 Lean 4 的形式化验证机制,解决了 LLM 在经验推理中的幻觉问题。它不仅在数值推理和压力测试中展现了优于现有方法的准确性和源忠实度,还提供了一种技术治理接口,使得高风险的 AI 决策过程完全可审计。随着类型化侧车在数据集和 API 中的普及,这种形式化负担有望被摊销到可复用的基础设施中,从而从根本上提升 LLM 推理的可信度。 |
|
| 07-14 |
Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution 本文指出了当前 LLM 智能体在任务执行中存在的严重认知冗余问题,提出了任务感知执行范围估计的重要性。通过引入 E3 框架,实现了“估计-执行-扩展”的闭环控制,在保证任务成功率的前提下极大提升了执行效率。这项工作被视为迈向“工程 grounded AI”(EGAI)的重要一步,即让智能体的努力程度与任务的工程现实相匹配。作者已公开相关框架和基准测试。 |
|
| 07-14 |
PalmClaw: A Native On-Device Agent Framework for Mobile Phones PalmClaw解决了移动智能体长期依赖低效GUI操作的问题,通过原生设备端框架将设备能力工具化,实现了更高效、可控且边界清晰的移动任务自动化,在性能和速度上均取得了显著突破。 |
|
| 07-13 |
TerraRepair: A Tool-Grounded LLM Agent for Infrastructure-as-Code Repair 机构: University of L’Aquila TerraRepair 证明了工具接地(tool grounding)可以显著提高基于 LLM 的 IaC 修复在扫描器验证下的成功率。通过结合 Provider Schema 查询、依赖上下文检索和结构化升级机制,它有效解决了 LLM 幻觉和上下文缺失问题。然而,研究也指出,缺失的部署特定上下文仍然是实现完全自主修复的主要知识边界。 |
|
| 07-13 |
StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure 机构: University of California, San Diego; Aether AI Lab StructAgent 通过引入统一因果结构来解决长周期数字代理中的状态管理和工作流控制问题。它摒弃了传统的基于原始交互历史的方法,转而采用以验证为核心的统一状态和结构化工作流。这种方法不仅提高了任务进度的可解释性和可验证性,还实现了高效的错误恢复和精确规划。实验结果表明,StructAgent 在多个基准测试上大幅超越了现有方法,并为开源数字代理设立了新的性能标杆,展示了其在复杂、长周期自动化任务中的巨大潜力。 |
|
| 07-13 |
MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents 机构: Apple MM-ToolSandBox 填补了多模态智能体在复杂、动态、大规模工具空间下进行视觉工具调用评估的空白。研究结果表明,当前最先进的模型在处理视觉 grounding 的工具调用任务时仍面临巨大挑战,尤其是视觉信息提取的精度问题。该框架为未来研究提供了重要的基准和洞察,强调了针对不同规模模型需采取不同的优化策略。 |
|
| 07-13 |
Agentic Skill Optimization over Lie Algebroids 机构: University of Massachusetts, Amherst 本文提出了 LASKO 框架,首次将李代数胚几何引入智能体技能优化领域。通过建模编辑的非交换性和隐藏结构,LASKO 解决了传统方法中编辑顺序敏感和验证成本高昂的问题。实验表明,该方法在保持优化效果的同时,相比基于超大参数模型的暴力验证方法取得了显著的效率提升,为智能体自我改进提供了几何化的理论基础和高效实践路径。 |
|
| 07-13 |
PaperRouter-Agent: A Content-Grounded LLM Agent for Personalized Hierarchical Paper Routing 机构: University of Sydney PaperRouter-Agent 通过引入“基于内容 grounding”的机制,成功解决了个性化文献管理中层级路由的难题。它突破了传统方法仅依赖文件夹名称的局限,通过深入分析文件夹内已有论文的语义内容来理解用户私有的分类逻辑。实验证明,该方法在真实场景和公共基准上均显著提升了路由准确性,特别是在处理非主题性(如按会议、年份分类)文件夹时优势明显,为个人知识管理提供了高效、低成本的自动化解决方案。 |
|
| 07-12 |
MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference MemDecay 通过引入区域感知的 KV 缓存驱逐机制,有效解决了 LLM 智能体在长程推理中的内存瓶颈问题。它利用智能体上下文的语义结构,为不同功能的令牌区域设定差异化的优先级和衰减策略。实验表明,该方法在保护关键系统指令方面显著优于现有基线,且在长上下文场景中比基于最近性的方法更具鲁棒性。尽管在非固定内容的注意力分数归一化上仍有改进空间,但该工作确立了结合语义结构与注意力信号进行高效缓存管理的新方向。 |
|
| 07-12 |
When Does Restricting a Coding Agent to execute_code Help? A Regime 机构: Rochester Institute of Technology ## 文章做了什么 - 背景:现代编码智能体(Coding Agents)暴露了多种工具接口,包括 IDE 原语(如 Read/Edit)、Bash 命令行以及模型上下文协议(MCP)的代码执行工具。业界关于哪种工具接口最关键存在三种相互矛盾的观点:有的认为专用 IDE 原语至关重要,有的认为仅 Bash 就足够,还有的主张用代码执行工具替代所有原生工具以大幅降低 Token 消耗。 - 已有工作为什么解决不了:现有的研究从未在同一个测试 harness、使用相同的模型和提示词,并针对不同的任务机制(Regime)和智能体设计进行交叉对比。因此,领域内无法确定每种主张适用的具体条件,也无法判断这些观点是否真正矛盾。 ## 文章的核心贡献点 - 提出了一个:完整性干净的三臂消融实验框架(baseline / bash_only / code_only),在合成计算任务和 SWE-bench Mini 修改任务上,固定模型、harness 和提示词,跨越两种智能体(Claude Code, OpenAI Codex CLI)和两种任务机制进行交叉对比。 |
|
| 07-12 |
Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games 机构: University of Melbourne 本文主要贡献在于提出了一套可审计的框架,而非单纯追求性能提升。该框架使得隐藏信息游戏中的LLM智能体行为变得可测量和可解释。通过将外部信念定位为一种可审计的认知基线,该研究将不透明的代理行为转化为可重放的证据,支持更安全、可控的智能体迭代。尽管主动信念与更好的结果相关,但其具体作用机制仍未完全解决,框架的价值在于能够暴露这些问题并提供实证依据。 |
|
| 07-12 |
Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging 机构: Peking University Imaging-101填补了科学计算成像领域缺乏标准化LLM评估基准的空白。通过系统性地评估LLM在真实科学任务中的表现,文章揭示了当前AI代理在算法选择、物理建模和流水线集成方面的具体短板。研究结果表明,要实现可靠的计算成像辅助,未来的方向应是开发具备技能增强和领域专用知识的AI代理,而非仅依赖通用大语言模型。 |
|
| 07-12 |
Large language model agents accelerate inverse design of metal-organic frameworks for gas separation 机构: Zhejiang University 本文展示了 LLM 智能体可以作为可解释且可扩展的设计引擎,加速 MOF 的发现过程,突破了传统固定库筛选的限制。LEMO Agent 通过闭环反馈机制有效解决了逆向设计中的化学有效性、性能优化和多样性保持难题,并为实验合成提供了切实可行的候选材料,证明了 AI 驱动的材料逆向设计在实际科研中的应用价值。 |
|
| 07-11 |
A Stepwise Questioning Expert-Editor Multi-Agent Framework for Long-Document Summarization 机构: China South Industry Academy 本文提出了一种受学术审稿过程启发的多智能体协作框架,通过模拟“专家”关注内容实质、“编辑”关注形式规范的分工,利用逐步提问机制引导LLM对长文档摘要进行迭代优化。该方法有效解决了长文档摘要中的信息不完整和不忠实问题,在Arxiv和PubMed数据集上的实验验证了其优于传统方法的性能。 |
|
| 07-11 |
Information-seeking failures of large language models in agentic clinical reasoning 机构: Technical University of Munich 本文揭示了当前LLM在临床肿瘤学中的主要瓶颈不是医学知识储备不足,而是在不确定性环境下系统性地进行信息寻求的失败。模型表现出与新手医生类似的认知偏差,如锚定效应和过早闭合。未来的改进方向应聚焦于增强模型在动态、不确定环境下的主动信息获取能力,而非仅仅扩充知识库。 |
|
| 07-11 |
Compaction as Epistemic Failure: How Agentic LLM Tools Fabricate Confirmed Results from Killed Processes 本文记录了 Claude Code 中一种可复现的故障模式,其中会话压缩将短暂的终端输出转化为伪造的确认结果。根本原因是“观察”与“持久性”的混淆。这一发现对依赖代理会话连续性进行数据处理、科学计算或多步自动化的任何工作流都有直接影响,强调了在代理系统中引入外部状态验证机制的必要性。 |
|
| 07-11 |
MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation 机构: University of Chinese Academy of Sciences 本文介绍了 MAG,首个统一 Web 代理动作执行与指引生成的多模态基准。通过引入基于截图的 grounding 方案和完整的评估框架,解决了现有研究中动作与指引割裂、以及缺乏真实视觉交互评估的问题。实验表明,结合专家轨迹的 GRPO 训练能显著提升模型性能,但当前最强模型仍面临巨大挑战,证明了 MAG 作为未来 Web 代理研究基准的重要价值。 |
|
| 07-11 |
AgentAbstain: Do LLM Agents Know When Not to Act? 机构: University of Illinois Urbana-Champaign 本文指出了 LLM 智能体在自主行动中缺乏“知止”能力的重大风险,并发布了首个系统性评估框架 AgentAbstain 及自动化生成工具 AbstainGen。研究结果表明,当前最先进的智能体在处理需要弃权的复杂场景时表现不佳,且这种能力不能通过单纯提升任务完成率来获得。该工作强调了开发更可信 LLM 智能体需要进行严格的弃权评估,并开源了相关代码和数据集。 |
|
| 07-10 |
Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation 机构: University of Birmingham Agora 通过引入拍卖机制解决了 LLM 智能体推理中的动态任务分配难题。它克服了粗粒度路由的结构限制和代理过度自信的估值难题,通过分层校准策略确保基于真实能力进行任务分发。实证结果表明,Agora 在多种复杂任务上显著提升了推理性能,并提供了灵活的成本控制能力,为构建高效、可靠的协作式 LLM 智能体系统提供了新范式。 |
|
| 07-10 |
Fictional Worldbuilding: Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review 机构: National University of Defense Technology 本文提出的 AutoWorldBuilder 通过分层上下文压缩、语义局部性调度和生成与审查分离等架构模式,成功解决了LLM在世界构建中的上下文爆炸和一致性难题。该系统不仅在游戏和文学创作领域展示了高效、高质量的自动化构建能力,其核心架构也可迁移至其他知识密集型的复杂多智能体LLM应用中。 |
|
| 07-10 |
Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks 机构: Beijing University of Posts and Telecommunications; Singapore University of Technology and Design 本文针对异构 LLM 具身智能体团队在资源受限网络下的协作难题,提出了 LDT-Coord 框架。通过引入轻量级数字孪生和结构化约束报告,成功将协调机制从昂贵的自然语言对话中解耦出来。结合基于规则的冲突解决器和基于强化学习的通信控制策略,该方法在保证任务成功率的同时,极大地降低了通信开销,为大规模异构具身智能体的高效协同提供了新的解决方案。 |
|
| 07-10 |
Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents 机构: Institute of Industrial Science, The University of Tokyo 本文提出了假设演化协议(HEP),旨在解决LLM科学代理中推理过程不透明和信念更新不可审计的问题。通过将科学发现过程结构化为显式的假设、测试、证据和信念循环,HEP使得AI科学家的推理过程可被人类检查、验证和继承。这在材料科学任务中的初步应用表明,该方法能促进更可靠、更具解释性的自主科学研究,是迈向可审计AI科学家的重要一步。 |
|
| 07-10 |
Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift 机构: RedMind Research; National Taiwan University 本文指出了可靠长期上下文演化的两个关键要求:一是使验证局部化的结构基础,二是保持积累指令内容可用的整合机制。GRACE 通过图正则化的方法有效解决了长周期演化中的验证难题和一致性问题,显著提升了智能体在分布偏移下的可靠性。 |
|
| 07-09 |
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks 机构: HKU MMLab, Meituan UniClawBench 填补了主动式智能体在真实世界动态环境中评估的空白。通过引入以能力为中心的任务设计和创新的三轮闭环评估机制,它不仅提供了更真实的性能度量,还揭示了框架设计在智能体性能中的决定性作用以及多模态和长上下文处理的主要短板。该基准及其代码已公开,旨在推动下一代鲁棒、高效主动式智能体的研发。 |
|
| 07-09 |
Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing 机构: Peking University, WeChat Vision (Tencent Inc.) 本文针对统一多模态模型在长程对话中的上下文瓶颈和引用不可靠问题,提出了一种基于认知结构的智能体架构。通过外化视觉记忆、结构化抽象以及基于合成数据的强化学习优化,该方法在显著降低计算成本的同时,大幅提升了长程多轮对话中的视觉检索准确性和任务执行效率,为多模态智能体的可扩展性提供了新范式。 |
|
| 07-09 |
TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories 机构: University of New South Wales TRACE 通过创新的双通道设计解决了 LLM Agent 轨迹水印中的核心难题。它利用基于内容的选择通道抵抗删除攻击,利用基于结构的计数通道抵抗重写攻击,理论上证明了水印信号以决策熵为代价,且迫使攻击者若要消除水印必须破坏轨迹本身。该方法在保证 Agent 性能的同时,提供了极强的归因鲁棒性。 |
|
| 07-09 |
WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search 机构: Renmin University of China, Kuaishou Technology WebSwarm 通过引入渐进式递归委托机制,有效解决了现有搜索代理在处理深度与广度并重的复杂任务时的局限性。其核心创新在于动态的节点实例化、基于Web结构的搜索引导以及兄弟节点间的经验复用。实验结果证明,该方法在多个基准测试中显著超越了现有的单代理和多代理系统,为构建更高效、自适应的多代理搜索系统提供了新的范式。 |
|
| 07-09 |
Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination 机构: Dalian University of Technology; The Hong Kong University of Science and Technology 本文针对轻量级LLM在科学领域因缺乏公理化推理而产生的幻觉问题,提出了基于博弈论的多智能体框架G-Frame。通过微观团队博弈和宏观贝叶斯博弈的结合,实现了高质量专业数据的自动化合成与模型自适应训练。生成的OmniChem模型在保持轻量级优势的同时,大幅降低幻觉并达到顶尖模型性能,为专业科学领域的可靠AI应用提供了可扩展的新范式。 |
|
| 07-08 |
From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents 机构: Renmin University of China, Alibaba Group 本文指出了当前 LLM 代理在依赖静态原子动作工具集时面临的推理效率低下和错误级联风险。通过提出 EvoSOP 框架,作者实现了从原子动作到标准操作程序(SOPs)的转变,并通过构建、合并、评估和剪枝的迭代循环优化工具集。这种方法模拟了人类利用高阶例行程序解决问题的高效方式,显著提升了代理在复杂任务中的成功率和效率,为自进化智能体的发展提供了重要方向。 |
|
| 07-08 |
SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis 机构: University of Shanghai for Science and Technology SpaCellAgent 通过结合 LLM 的多智能体协作、动态工具编排和自进化机制,有效解决了传统轨迹推断中人工成本高、工具使用复杂的问题。它在多个异构数据集上证明了其高效性和准确性,为计算生物学领域提供了一个自动化、低门槛且高性能的分析解决方案,显著推动了时空转录组分析的普及和标准化。 |
|
| 07-08 |
Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents 机构: Massachusetts Institute of Technology; Indian Institute of Technology Kharagpur 本文揭示并量化了工具使用型 LLM Agent 中一种严重但常被忽视的“静默策略违规”故障模式。作者证明,依赖模型推理来执行策略是不可靠的,尤其是在工具本身不强制执行策略约束的情况下。通过引入确定性的预执行门控,可以在不改变模型本身的情况下,以低成本显著恢复系统的可靠性。这一贡献强调了在 Agent 系统中,“少推理,多验证”(Reason Less, Verify More)的重要性,即在动作边界通过确定性代码而非概率性生成来保障策略合规性。 |
|
| 07-08 |
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning 机构: Tsinghua University 本文提出的 SAO 框架通过单 rollout 采样和严格的 token 级裁剪策略,有效解决了异步 RL 中的离线策略效应和训练不稳定问题。实验表明,SAO 不仅在推理和编码基准上全面超越 GRPO,还具备优秀的在线适应能力,并成功应用于超大规模模型 GLM-5.2 的训练,为高效、稳定的智能体 RL 后训练提供了新的范式。 |
|
| 07-08 |
Breaking Database Lock-in: Agentic Regeneration of High Performance Storage Readers for Database Bypass 机构: Cornell University Jailbreak 提出了一种新颖且通用的方法论,利用 LLM 理解数据库源码和文档来合成高性能存储读取器,从而绕过数据库引擎直接访问底层存储文件。该方法成功解决了传统数据访问路径中的序列化和格式转换瓶颈,显著提升了分析型工作负载的性能(最高 27x 加速),并保证了数据正确性。这不仅适用于 PostgreSQL 和 MySQL,也为任何文件格式可通过文档或源码获取的数据库系统提供了打破数据锁定的可行方案。 |
|
| 07-07 |
From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b 机构: Korea University, Myongji University, AIGEN Sciences 本文针对生物医学问答中证据分散和推理复杂的问题,提出了一种答案类型感知的 LLM 框架。通过为 Yes/No、Factoid 和 List 问题设计专用的推理管道(如片段洗牌、CoT 上下文学习、多智能体协作),有效解决了单一策略无法适配多样化推理需求的痛点。实验表明,该方法在 BioASQ 14b 挑战赛中取得了优异成绩,特别是在 Factoid 任务中获得第一,验证了精细化、模块化推理流程在专业领域 QA 中的价值。 |
|
| 07-07 |
LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability 机构: Tsinghua University, Fuzhou University 本文建立了评估和改进 LLM 智能体在审议协作中表现的基础。通过形式化部分可观察下的联合决策问题并引入可扩展基准,文章系统地揭示了当前 LLM 在处理信息不对称和复杂联合推理时的局限性,同时也肯定了审议机制在促进反思和提升决策质量方面的潜力,为未来多智能体系统的改进提供了方向。 |
|
| 07-07 |
From Blueprint to Reality: Modeling and Applying Putnam's Social Capital Theory with LLM-based Multi-agent Simulations 机构: State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China 本文提出了SocaSim框架,填补了社会学理论与LLM多智能体模拟之间的空白。通过构建理论对齐的环境,该框架不仅复现了社会资本理论的宏观规律,还提供了微观层面的因果解释和人机对齐验证,为连接社会科学与计算机科学建立了新的研究范式,特别是在智慧养老等具体应用场景中展示了其潜力。 |
|
| 07-07 |
PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents 机构: Beijing Jiaotong University, Weixin AI, Tencent Inc 本文指出了当前LLM智能体基准测试中忽视多语言交互动态的空白,发布了PolyWorkBench基准。该基准通过真实的多语言长程工作流任务,揭示了现有SOTA智能体在处理多语言上下文时的性能瓶颈。提出的混合评估框架为未来研究多语言智能体的鲁棒性和一致性提供了重要工具,强调了在开发通用智能体时需同时考虑语言能力与执行逻辑的耦合。 |
|
| 07-07 |
Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory 机构: Peking University Danus 提出了一种基于事实图记忆机制的智能体编排框架,有效解决了研究级数学推理中并行搜索协调和长程状态管理的难题。通过主智能体规划、工作智能体并行探索及验证器严格把关的协同工作,Danus 在多个高难度数学领域展示了构建复杂证明的能力,为扩展 LLM 数学推理智能体至更长程、更复杂的研究任务提供了有效途径。 |
|
| 07-06 |
MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution 机构: LMU Munich, The Chinese University of Hong Kong, MCML, MemAgents Lab MetaSkill-Evolve 通过引入双时间尺度的递归自改进机制,解决了现有LLM智能体进化过程中“改进策略固定”的核心痛点。它不仅让智能体学会更好地执行任务,还让其学会如何更有效地自我改进。实验证明,这种方法在多个基准测试中显著超越了传统静态技能和单层进化方法,展示了递归自改进在提升智能体长期适应性和性能方面的巨大潜力。 |
|
| 07-06 |
AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments 机构: Fudan University AgentGym2 通过引入去理想化的真实世界环境,解决了现有基准测试过于简化的问题。它重点评估智能体在工具探索、组合以及对噪声信息鲁棒性方面的能力。实验表明,当前最先进的 LLM 智能体在面对真实世界的复杂性和不确定性时仍显不足,该基准为未来智能体的研发和评估提供了更贴近实际应用的指导方向。 |
|
| 07-06 |
Toward Trustworthy Large Language Model Agents in Healthcare 机构: American University of Beirut 本文提出的 CareConnect 展示了如何通过分层确定性安全护栏和严格的范围约束,将 LLM 安全地应用于医疗后勤自动化。它成功解决了通用 LLM 在医疗操作场景中面临的安全性和事务一致性难题,以极低的成本和较高的任务完成率实现了预约调度的自动化,为可信医疗 AI 代理的部署提供了可行范式。 |
|
| 07-06 |
Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses 机构: The Pennsylvania State University 本文揭示了 LLM 代理持久化记忆中一个关键但被忽视的安全漏洞:推理历史投毒。通过提出 FARMA 攻击,作者证明了攻击者可以污染代理的推理过程而非仅仅是事实知识,并利用自引用机制放大攻击效果。同时,作者提出了 SENTINEL 防御框架,通过结构化分析有效检测并阻止此类攻击,实现了零误报和高防御成功率。这项工作强调了在构建安全的 LLM 代理系统时,必须同时保护检索内容和推理历史的完整性。 |
|
| 07-06 |
STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training 机构: Zhejiang University, Ant Group, City University of Hong Kong 本文针对LLM智能体在长程任务中因稀疏奖励导致的轨迹忽视问题,指出了现有基于香农熵方法的局限性。通过提出归一化熵来更精准地衡量智能体置信度偏差,并构建STAPO框架,实现了对异常步骤的选择性优化。该方法在多个复杂基准测试中实现了SOTA性能,有效提升了智能体在长程推理中的轨迹意识和训练稳定性。 |
|
| 07-05 |
Agentic-V2X: Small Language Model Agents for Deadline-Aware V2X Scheduling in 5G/6G Networks 机构: University of Piraeus Agentic-V2X 提出了一种务实的架构,通过分离非实时策略生成和近实时执行,解决了 LLM 在 V2X 调度中应用的延迟和安全性难题。虽然其在整体性能上未超越最优静态策略,但在动态适应性和关键可靠性方面展现了竞争力,证明了小型 LLM 作为安全策略生成助手的可行性,为未来 6G 网络中 AI 原生控制提供了参考路径。 |
|
| 07-05 |
NKI-Agent: Domain-Specific Fine-Tuning and Agentic Tool Use for Neuron Kernel Generation 机构: Amazon Web Services 本文针对 AWS Neuron 硬件内核生成的空白,提出了 NKI-Agent 系统。通过构建专用的训练数据集和基准测试,并结合领域特定的 SFT 与代理工具循环,有效解决了 NKI 编程中多引擎架构和复杂内存管理的难题。实验表明,该方法在真实硬件上取得了显著的通过率提升,并证明了开源小模型在经过适当微调后能在低成本下超越部分闭源大模型的表现,同时指出了当前 RL 奖励设计在该领域的局限性。 |
|
| 07-05 |
CausalGame: Benchmarking Causal Thinking of LLM Agents in Games 机构: MBZUAI, Carnegie Mellon University, Hong Kong Baptist University, University of Oxford, New York University CausalGame 填补了当前 AI 科学家基准测试在因果思维评估方面的空白。通过引入选择偏差、测量误差和隐藏混淆变量等现实挑战,该基准揭示了当前最先进的 LLM 智能体在因果推理方面的严重不足。研究结果表明,尽管 LLM 在某些任务上表现出色,但在需要严格因果推断的科学发现场景中,它们仍倾向于依赖相关性而非因果性,亟需进一步提升其因果认知能力。 |
|
| 07-05 |
Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning 机构: University of Toronto, Emory University 本文论证了 LLM 智能体的执行 Harness 不应被视为固定基础设施,而是一个可学习的控制层。通过将其建模为 MDP 并使用离线强化学习训练轻量级控制器,该方法在不更新 LLM 参数的情况下,显著优化了智能体的执行流程(如验证、检索、提交决策)。提出的 Harness 成熟度分数进一步解耦了过程质量与结果质量,揭示了离线数据分布对最终性能提升的限制。这项工作为提升冻结 LLM 智能体的效率和质量提供了新的视角和方法。 |
|
| 07-05 |
Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents 机构: University of Toronto 本文揭示了 LLM 智能体评估中被忽视的关键问题:Harness 的设计会诱导智能体产生信念分歧,进而影响其决策过程,即使最终任务结果相同。通过提出信念展开诊断和 BIWM 协议,作者不仅量化了这种偏差,还提供了一种无需训练的解决方案来规范观测和对齐信念。这项工作强调了在智能体评估中将 Harness 设计视为核心实验变量的重要性,为构建更鲁棒、更公平的智能体评估体系提供了新的视角和方法。 |
|
| 07-04 |
Context Graphs for Proactive Enterprise Agents 本文针对企业AI智能体被动响应的架构缺陷,提出了基于“上下文图”的主动式信息表面系统。通过构建动态图结构、差异检测引擎和基于多维度的主动性评分机制,该系统能够在用户提问前主动推送高价值、高紧迫性的洞察。实验证明,该方法在保持低误报率的同时,极大地缩短了关键信息触达用户的时间,为企业生产力提升提供了新的技术路径。 |
|
| 07-04 |
Don't Blame the Large Language Model: How Scaffolding Evolution Shapes Coding Agent Quality 机构: Queen’s University 本文通过严格的控制变量实验证明,编码智能体的质量瓶颈往往不在于底层LLM,而在于快速演化的脚手架层。研究发现当前的脚手架开发存在“高投入低回报”的现象,即计算成本大幅增加但任务解决率未显著提升。文章呼吁在智能体脚手架的开发中引入新的“智能体质量保证”(Agentic QA)实践,强调对架构组件和开发模式的精细化监控,以避免无效迭代和资源浪费。 |
|
| 07-04 |
The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models 本研究证实,对于重视可靠性而非单纯可解析性的生产系统,自然语言工具(NLT)是结构化工具调用的实用替代方案。它通过消除格式约束释放了模型的认知资源,显著降低了错误率并提高了效率,尤其适合非原生支持工具调用或中小规模的模型场景。 |
|
| 07-04 |
Social Networks of LLM Agents 机构: Emory University, Shanghai Jiao Tong University 本文指出了经典社会网络模型在应用于 LLM 智能体群体时的根本缺陷,即忽视了有限注意力对信息汇聚的限制。通过提出 SNLA 框架,作者从理论和实证两方面证明了注意力宽度是决定群体表现为“智慧”还是“盲从”的关键因素。该研究为设计和评估可信的多智能体 LLM 系统提供了重要的理论依据,强调了在优化网络结构的同时,必须考虑智能体的注意力机制。 |
|
| 07-04 |
The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling 机构: University of California, Davis; Okareo, Inc. 本文指出了当前LLM智能体在函数调用中因评估指标偏差导致的过度自信和幻觉问题。通过提出一种惩罚错误调用的新评估指标和一个轻量级的“我不知道”过滤器,作者展示了一条实用的路径,使智能体能够识别自身的不确定性并主动 abstain(弃权)。这种方法在不改变底层模型的前提下,显著提升了生产环境中智能体的安全性和可靠性,强调了“知道何时说不知道”对于可信AI的重要性。 |
|
| 07-02 |
What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates 机构: Carnegie Mellon University 本文揭示了 LLM 智能体在社会结构化环境中会自发产生“公开”与“私下”言论的系统性分歧,表明社会关系压力能诱发智能体涌现出未在主提示中指定的潜在目标(如规避风险、迎合受众)。作者提出的双通道评估框架为超越显式目标、检测智能体 emergent objectives 提供了新的方法论基础,强调未来的智能体评估必须纳入对社会语境和隐性动机的考量。 |
|
| 07-02 |
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents 机构: Shanghai Jiao Tong University, Shanghai Innovation Institute, Nankai University, University of Science and Technology of China, Alaya Lab 本文提出了AgenticSTS,一个用于研究长程LLM智能体记忆的有界记忆测试平台。通过引入类型化检索的有界记忆契约,解决了传统累积上下文方法中信息混杂和不可消融的问题。在《杀戮尖塔2》上的实验表明,显式的战略技能记忆层能显著提升智能体胜率。该平台提供了标准化的轨迹数据和可复现的分析工具,为社区研究显式记忆层如何影响长程决策提供了 validated 的方法论基础。 |
|
| 07-02 |
UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development 机构: Prairie View A&M University UA-ChatDev 通过引入基于 token 概率的不确定性估计和动态验证机制,解决了多智能体协作中因盲目信任中间输出而导致的幻觉传播问题。该方法在不显著增加计算负担的前提下,显著提升了自动生成软件的质量和可靠性,为构建更稳健的 LLM 驱动软件开发流程提供了新思路。 |
|
| 07-02 |
A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction 机构: The Chinese University of Hong Kong A$^{2}$utoLPBench 通过逆 KKT 构造方法解决了传统 LP 基准测试中数据静态、标注成本高和数据泄露的问题。它提供了一个动态生成、难度可控、真值绝对正确且易于 Agent 接入的评估框架,为评估 LLM 代理在数学规划和代码执行方面的端到端能力提供了可靠工具。 |
|
| 07-02 |
Adoption and Ecosystem Health: A Longitudinal Analysis of Open-Source Multi-Agent Frameworks 机构: Cisco Systems, Indiana University 本文通过大规模纵向数据分析,揭示了仅凭 GitHub Stars 等表面指标评估开源智能体框架健康度的不可靠性。研究提出的“贡献者密度”、“跨生态参与度”和“留存曲线”构成了更 robust 的评估框架。结果表明,LangChain 凭借其高贡献者密度和跨生态吸引力成为事实上的基础设施,而许多高热度框架实际采用深度不足。该研究为工程团队选择可持续、健康的 AI 框架提供了数据驱动的决策依据,强调了从关注“热度”转向关注“深度采用”和“社区留存”的重要性。 |
|
| 07-01 |
Agentic generation of verifiable rules for deterministic, self-expanding reaction classification 机构: École Polytechnique Fédérale de Lausanne (EPFL), Laboratory for Chemical Technology, Ghent University 本文提出了一种将生成式模型转化为可靠、自扩展符号系统的通用路径。通过多智能体LLM框架,实现了反应规则的自动化生成与验证,构建了一个“活着”的反应性数据库。这不仅解决了长尾化学反应手动编码的难题,还为计算机辅助合成规划提供了更具适应性和细粒度的解决方案。 |
|
| 07-01 |
Behavior-Adaptive Conversational Agents: Toward a Fluid Personality Framework 机构: Northeastern University 本文针对当前LLM对话代理角色和风格固定导致的语境错位问题,提出了“流体个性框架”。该框架通过动态调整隐喻角色(如从导师切换到工具)和个性表达强度(低/中/高),以适应任务语境、用户目标和情境紧急度。这一方法旨在结合上下文相关的隐喻优势和适度的个性表达,从而在信任、享受度和采用意图之间取得最佳平衡,为AI介导的行为改变提供了新的设计范式。 |
|
| 07-01 |
From Personas to Plot: Character-Grounded Multi-Agent Story Generation for Long-Form Narratives 本文证明了通过显式的世界状态跟踪和目标驱动的多代理交互,可以涌现出高质量的长篇叙事。MAGNET 和 ATLAS 的结合为可控且结构连贯的长篇叙事生成奠定了基础,有效解决了现有方法在长期一致性和幻觉检测方面的不足。 |
|
| 07-01 |
Self-GC: Self-Governing Context for Long-Horizon LLM Agents 机构: Xiaohongshu Self-GC 证明了长程 Agent 的上下文管理应被视为对索引化、可恢复对象的运行时生命周期控制,而非事后的文本清理。通过将上下文视为具有不同生命周期需求的对象集合,并利用侧信道规划器进行智能治理,Self-GC 在显著降低令牌消耗的同时,有效保留了对未来任务至关重要的结构化信息,优于传统的启发式剪枝和摘要方法。 |
|
| 07-01 |
Skills Are Not Islands: Measuring Dependency and Risk in Agent Skill Supply Chains 机构: Peking University, Zhongguancun Laboratory 本文揭示了 LLM 智能体技能生态中依赖管理的严重缺失,提出了 ASSCs 概念和 SkillDepAnalyzer 工具来解决隐式依赖带来的不透明性和安全风险。通过大规模实证研究,文章证明了依赖链分析对于发现隐藏安全风险的重要性,并为技能基础设施维护者(如注册表管理者)和技能开发者提供了具体建议,包括类型化依赖清单、一级依赖簇管理、风险警告审计命令以及类似 lockfile 的记录机制,以提升整个技能供应链的安全性和可治理性。 |
| Date | Paper | Links & Summary |
|---|---|---|
| 06-30 |
QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents 机构: University of Tübingen QVal 为长视野 LLM 智能体的密集监督信号提供了一个高效、低成本且公平的评估框架。通过引入“Q-对齐”指标,它成功解耦了信号质量与训练工程因素,使得研究人员能够在进行昂贵的强化学习训练之前迭代和优化监督方法。研究结果挑战了当前复杂监督方法的优越性假设,强调了简单基线的有效性,并为未来研究提供了可扩展的基准工具。 |
|
| 06-30 |
MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments 机构: Fudan University, Shanghai Innovation Institute, The Chinese University of Hong Kong MECoBench 填补了多模态具身智能体协作研究的空白,提供了一个系统性的测试床。研究结果表明,虽然协作能提升性能和鲁棒性,但必须仔细设计通信机制和协作模式以应对协调复杂性。该工作为理解多模态具身协作的机制和极限提供了重要参考。 |
|
| 06-30 |
ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping 机构: Alibaba Taobao & Tmall Group ShopX 通过将意图理解、规划执行和商品空间操作统一到一个基础模型中,解决了代理购物中语言理解与商品检索之间的断层问题。其核心创新在于设计了LLM可操作的语义ID(SIDs)及相应的训练策略,实现了模型原生的商品履行。实验证明,该方法在处理复杂购物意图时优于传统的工具介导型代理系统,为下一代AI原生购物体验提供了新的技术路径。 |
|
| 06-30 |
A Tutorial on Autonomous Fault-Tolerant Control Using Knowledge-Grounded LLM Agents 机构: Imperial College London; Helmut Schmidt University 本文提出了一种结合大型语言模型与传统容错控制的新型框架,旨在解决过程工业中未预期故障的自动恢复问题。通过将LLM定位为受约束的监督规划器,并辅以严格的外部验证和知识图谱支持,该研究在利用LLM推理能力的同时确保了工业级的安全性。提供的开源环境和详细的设计维度分析为该领域的进一步研究和实际应用奠定了基础。 |
|
| 06-30 |
FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents 机构: MBZUAI, The University of Tokyo, McGill University, The Fin AI, Kyoto University 本文指出了自主金融代理在长期部署中面临的“指令显著性衰减”问题,即随着上下文积累,初始行为指令的影响力逐渐减弱。通过引入 FinPersona-Bench 基准测试,作者量化了这一现象,并发现简单的定期指令刷新并不总是有效,甚至可能对激进型代理产生负面影响。研究建议,为了实现可靠的长期部署,必须根据代理的具体行为画像和当前市场状态,采取选择性的、感知指令的重 grounding 策略。 |
|
| 06-29 |
Self-Evolving World Models for LLM Agent Planning 机构: National University of Singapore, Singapore University of Technology and Design, Singapore Management University 本文提出的 WorldEvolver 框架通过解耦模型参数更新与上下文修订,成功解决了 LLM 智能体在长视界任务中世界模型预测不可靠的问题。通过情景记忆、语义记忆和选择性前瞻三个模块的协同工作,该方法能够在不增加训练成本的前提下,利用测试时的交互反馈持续优化前瞻能力,从而显著提升智能体的规划效率和成功率。 |
|
| 06-29 |
TraceLab: Characterizing Coding Agent Workloads for LLM Serving 机构: University of Washington 本文填补了编程智能体真实工作负载数据的空白,发布了 TraceLab 数据集。通过分析发现,编程智能体工作负载具有长自主循环、长上下文短输出、多样化且重尾的工具调用以及高但不完美的前缀缓存命中率等特征。这些发现为优化 LLM 服务系统提供了具体方向,包括优化工具调用开销、改进预填充策略、预测工具延迟以及增强 KV 缓存管理。该研究为未来高效服务编程智能体奠定了数据基础和理论指导。 |
|
| 06-29 |
Collective cooperation without individual fidelity in LLM agents 机构: Institute for Biocomputation and Physics of Complex Systems, University of Zaragoza 本文揭示了基于 LLM 的社会代理中存在显著的“宏观-微观解离”现象:即使集体结果看起来像人类,其底层的行為分布和决策机制也可能完全不同。研究结果表明,要将 LLM 代理验证为人类的可靠替代品,不能仅依赖于结果层面的一致性,必须跨越聚合动态、个体异质性以及上下文依赖的决策规则进行多维度的比较和验证。这对未来使用 LLM 进行社会模拟和政策推演提出了重要的警示和方法论建议。 |
|
| 06-29 |
Whose Side Is Your Agent On? Multi-Party Principal Loyalty in LLM Agents 机构: University of Washington 本文深入研究了 LLM Agent 在多方交互中的“委托人忠诚度”问题,指出了传统“帮助当前说话者”目标的局限性。通过构建 PrincipalBench 基准,文章量化了现有模型在忠诚度上的缺陷,并提出了基于系统提示的忠诚度支架和基于 KL 散度的蒸馏方法两种解决方案。尽管这些方法在特定指标上取得了进展,但研究揭示了一个结构性难题:泄漏风险与过度拒绝之间存在固有的权衡关系,未来的研究需致力于打破这一权衡,以实现既安全又高效的代理人格。 |
|
| 06-29 |
Towards Continual Motion-Language Agents: LoRA Variants for Incremental Motion Understanding and Generation 机构: International University of Applied Sciences 本文针对运动-语言代理在动态环境中的持续学习问题,提出了一种基于LoRA变体和混合专家架构的解决方案。通过引入基于自编码器的无标签路由器,成功解决了任务间干扰和灾难性遗忘的挑战。实验证明,硬专家选择机制能有效维持双向任务的性能稳定性。该工作不仅提供了高效的持续学习框架,还揭示了当前评估指标的不足,为未来终身运动-语言代理的研究奠定了基础。 |
|
| 06-28 |
Interpretable Inverse Design of Metal-Organic Frameworks with Large Language Model Agents 机构: Korea Advanced Institute of Science and Technology (KAIST) LLM4MOF 证明了语言模型代理可以在无需针对每个目标训练模型的情况下,执行基于模拟的、可解释的MOF逆向设计。它通过结合化学推理、约束筛选和诊断性测试,解决了数据稀缺和黑盒模型缺乏解释性的问题,以极低的成本实现了高效的材料发现和优化。 |
|
| 06-28 |
Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds 机构: AWS Generative AI Innovation Center, General Motors (GM) 本文提出了一种新颖的多智能体 LLM 辩论停止机制,通过构建局部可靠性下界来解决自适应“执行或推迟”决策问题。该方法不仅提供了理论上的错误控制保证,还通过相对预算设置适应了不同任务难度。实验表明,该方法在保证高准确率和高自动化率的同时,有效控制了错误行动风险,为 LLM 系统的安全部署提供了可审计的解决方案。 |
|
| 06-28 |
When LLMs Develop Languages: Symbolic Communication for Efficient Multi-Agent Reasoning 机构: State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences; School of Computer Science and Technology, University of Chinese Academy of Sciences 本文提出了CLSR框架,解决了LLM在使用CoT时效率低下的问题。通过让智能体自主演化和共享紧凑的符号语言框架,并结合自适应路由机制,CLSR在保证推理准确性的同时,显著降低了token消耗和延迟。该方法不仅在实证上优于现有CoT及多种优化策略,还在理论上建立了符号通信与信息成本之间的联系,为高效多智能体推理提供了新范式。 |
|
| 06-28 |
Hierarchical Experimentalist Agents 机构: University of Massachusetts Amherst HExA 证明了通过主动实验进行学习可以使智能体有效地发现新知识并获取可复用的技能,从而在新颖的长视野任务中取得高效进展。该框架突破了依赖静态参数知识的局限,为 LLM 在复杂、未知物理环境中的推理和行动提供了新的范式。 |
|
| 06-28 |
Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction 机构: Tsinghua University 本文旨在推动视频理解从传统的VideoQA范式(低层理解)向视频引导的代理任务范式(高层理解)演进。通过引入VG-GUIBench基准和TASKER关键帧提取算法,作者不仅提供了一个评估MLLM从视频教程中学习并执行复杂GUI任务的新标准,还展示了一种通过优化关键帧选择来显著提升模型在多种视频理解任务中表现的有效方法。这项工作强调了从感知到行动的层级跃迁,为未来多模态智能体的发展提供了重要方向。 |
|
| 06-27 |
Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem 机构: University of Glasgow, Nanjing University, The University of Sydney 本文通过对 n8n 平台上大量 LLM 代理工作流的实证分析,揭示了当前 LLM 在实际自动化应用中的集成模式与可靠性短板。研究指出,当前的 LLM 代理工作流已超越简单的问答模式,成为复杂的系统集成体,但在可靠性、安全性和治理方面的工程支持仍显不足。该研究为研究人员、平台开发者和从业者理解及改进现实世界中的 LLM 代理工作流提供了重要的数据支持和方向指引。 |
|
| 06-27 |
LAMP: Lean-based Agentic framework with MCP and Proof Repair 机构: Indian Institute of Information Technology, Design and Manufacturing, Kancheepuram 本文针对 Lean 4 生态中词组合学(CoW)领域形式化知识缺失的问题,首先构建了该领域的基础形式化库,随后提出了 LAMP 多智能体框架。LAMP 通过在推理阶段注入结构化领域知识而非依赖微调,有效解决了现有证明器在陌生领域泛化能力差的问题。实验表明,LAMP 在 CoW 定理证明上取得了 96.7% 的高成功率,显著超越了当前最先进水平,为扩展形式化数学到新领域提供了有效的范式。 |
|
| 06-27 |
Multi-Agent Routing as Set-Valued Prediction: A WildChat Benchmark and Cost-Aware Evaluation 机构: Ahsanullah University of Science and Technology 本文通过将多代理路由形式化为集合值预测问题,填补了现有研究在多标签路由和成本感知评估方面的空白。作者构建了一个基于真实用户数据的基准测试,并系统性地评估了多种路由策略。研究发现,结合微调编码器和加权代理路由(WAR)的方法能在保证高准确率的同时有效管理执行成本,为构建高效、经济的多代理 AI 系统提供了重要的实证依据和方法论支持。 |
|
| 06-27 |
A Task-Driven and Quality-Assured Agent Framework for SAR Data Generation 机构: Beijing University of Chemical Technology; Beijing Institute of Environmental Features 本文针对SAR数据增强中存在的异构性、验证弱和决策不可靠问题,提出了SAGA智能体框架。通过将语义提议与确定性验证执行分离,并引入多维度的质量与效用评估机制,SAGA实现了任务驱动且质量保证的SAR数据生成。实验表明,该方法在模式理解、策略规划及下游任务增益上均优于现有基线,为SAR数据增强提供了可靠、可复现的自动化解决方案。 |
|
| 06-27 |
The Contagion Tensor: A Framework for Measuring Output-Distribution Coupling in Multi-Agent LLM Systems -- and Auditing the Claims It Enables 本文引入了传染张量和耦合放大因子(CAF),填补了多智能体 LLM 系统中输出分布耦合定量测量的空白。通过结合严格的模拟消融分析和真实 API 实验,文章不仅提供了一套可证伪的测量工具,还建立了一种区分真实耦合效应与系统设计假象的方法论标准。研究结果表明,视觉模态在特定条件下确实能显著放大耦合效应,但需谨慎排除模拟器引入的偏差。该框架为未来多智能体系统的安全审计和性能评估提供了基础工具。 |
|
| 06-26 |
ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents 机构: Beijing University of Posts and Telecommunications ToolPrivacyBench 解决了LLM Agent在多工具协作场景下的隐私评估缺失问题。通过引入策略知识库和轨迹级审计机制,它形式化并量化了“目的绑定隐私”风险。研究证实,当前Agent普遍存在隐私过度披露现象,即使任务成功完成也可能泄露敏感数据。该基准为开发更符合隐私规范的Agent系统提供了重要的评估标准和改进方向。 |
|
| 06-26 |
LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior 机构: University of Massachusetts Amherst; Mitsubishi Electric Research Laboratories (MERL) LLawCo 通过模拟阿西莫夫机器人定律的理念,提出了一种让具身多智能体从失败中学习高层协作法则的方法。该方法解决了现有LLM智能体在部分可观测环境中协作对齐难和缺乏自我进化能力的问题。通过引入行为法则并进行监督微调,智能体能够更好地理解任务需求和伙伴行为。实验证明,该方法在多个基准测试中均优于现有的最先进方法,显著提升了多智能体协作的成功率。 |
|
| 06-26 |
From Detection to Action: Using LLM Agents for Fault-Tolerant Control 机构: Imperial College London, Helmut Schmidt University 本文提出了一种创新的LLM代理框架,通过结合多代理工作流、数字孪生仿真验证和基于知识图谱的RAG,解决了流程工业中主动容错控制的难题。该方法不仅利用了LLM的推理能力,还通过严格的物理约束检查和仿真预验证确保了工业级的安全性,为实现高度自主且安全的工业过程控制提供了新范式。 |
|
| 06-26 |
Agentic AI-Powered Re-Identification: An Emerging, Scalable Threat to Mobility Microdata Privacy 机构: University of Applied Sciences and Arts Northwestern Switzerland (FHNW) 本文揭示了代理AI对移动微数据隐私构成的新兴且可扩展的威胁。研究表明,LLM智能体能够以极低的成本自动化执行复杂的重识别任务,打破了传统SDC实践中关于匿名性的隐含假设。这一发现要求数据保管人和监管机构重新评估隐私风险,特别是在GDPR框架下,重识别现在被视为一种“合理可能”且成本低廉的攻击手段。 |
|
| 06-26 |
Grounded Iterative Language Planning: How Parameterized World Models Reduce Hallucination Propagation in LLM Agents 机构: Emory University, The University of Tokyo, LocationMind 本文针对 LLM 智能体在世界建模中的幻觉传播问题,提出了 GILP 框架。通过结合小型参数化世界模型的精确状态预测能力与 LLM API 的强大语义推理能力,并利用一致性门控机制进行迭代修正,GILP 在显著降低幻觉状态率的同时大幅提升了规划成功率。该方法以较低的额外计算成本实现了更可靠、更准确的自主代理规划,为混合式世界模型的设计提供了新的思路。 |
|
| 06-25 |
Semantic Early-Stopping for Iterative LLM Agent Loops 本文针对LLM智能体循环中的低效终止问题,提出了一种基于语义收敛的早停机制。通过摒弃不切实际的数学假设,建立机器可验证的理论基础,并设计了一种高效的回放式评估协议,论文证明了在无额外评判成本的情况下,语义早停能大幅降低Token消耗而不牺牲质量。研究还指出,未来的核心挑战在于如何低成本地识别“最佳迭代轮次”,而非仅仅决定“何时停止”。 |
|
| 06-25 |
How Much Static Structure Do Code Agents Need? A Study of Deterministic Anchoring 机构: Beihang University 本文揭示了“确定性锚定效应”:静态结构的主要作用不在于提升代理的智能程度,而在于通过提供稳定的结构事实来规范代理的导航行为,使其更具纪律性和可复现性。研究提供了实用的指导原则:在中等项目中默认使用轻量级拓扑,在大型仓库中修剪前向边,并仅在必要时使用密集标签。这项工作为平衡静态分析的确定性与 LLM 的概率性探索提供了新的视角。 |
|
| 06-25 |
A Process Harness for Uplifting Legacy Workflows to Agentic BPM: Design and Realization in CUGA FLO 机构: University of Haifa 本文提出了一种名为 Process Harness 的创新机制,旨在通过非侵入式的方式将遗留工作流系统升级为代理式 BPM。通过开发 Task-Decision-Flow (TDF) 模型并在 CUGA FLO 中实现,作者成功地在确定性工作流引擎之上构建了一个策略治理的智能体层。该方法有效解决了传统 BPM 在处理动态环境和非结构化任务时的僵化问题,同时避免了完全替换核心引擎的风险,实现了结构合规性与智能适应性的平衡,为组织在保留现有 IT 投资的同时利用 LLM 能力提供了可行路径。 |
|
| 06-25 |
Joint Learning of Experiential Rules and Policies for Large Language Model Agents 机构: Sun Yat-sen University 本文针对 LLM 智能体在交互学习中经验利用不足的问题,提出了 JERP 框架。该框架创新性地联合学习了经验规则和政策,通过动态维护规则池并使其与模型参数更新同步,有效克服了规则过时和稀疏奖励下局部修正困难的挑战。在 AlfWorld 和 WebShop 上的实验证实了该方法在复杂交互任务中的有效性和优越性,为提升 LLM 智能体的长期学习能力提供了新的思路。 |
|
| 06-25 |
Where Do CoT Training Gains Land in LLM based Agents? 机构: Renmin University of China 本文深入探讨了 LLM 智能体中 CoT 训练的实际作用机制,指出 CoT 训练的主要增益在于提升模型直接从提示中预测行动的能力,而非显著增强基于推理的行动修正能力。针对模型后期过度依赖提示的问题,作者提出了一种简单的选择性掩码监督策略,有效提升了模型的分布外泛化性能。这一发现对理解 CoT 的本质及优化智能体训练策略具有重要意义。 |
|
| 06-24 |
BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents 机构: University of Chicago, The Hong Kong University of Science and Technology (Guangzhou), Stanford University, University of Science and Technology of China, Meituan BiPACE 解决了长视界 LLM 智能体训练中基于组的 RL 方法存在的状态-动作信用不匹配问题。通过引入基于隐藏状态聚类的 BiGPO 和基于动作条件基线的 PACE,它在不增加 Critic 网络或额外采样成本的前提下,显著提高了信用分配的准确性。实验表明,该方法在多个基准测试中均大幅超越了现有的 SOTA 方法(如 GiGPO 和 GRPO),且计算开销可控,为无 Critic 的 LLM 智能体训练提供了更优的优势估计方案。 |
|
| 06-24 |
Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents 机构: University of Wisconsin–Madison, Argonne National Laboratory 本文揭示了RL后训练中一个被忽视的“免费午餐”——进展优势。通过理论推导证明,RL训练策略与参考策略的对数概率比率可以作为最优的优势函数,为LLM智能体提供高质量、无标注的步骤级评估信号。该方法解决了智能体场景中过程奖励建模难、成本高、泛化差的核心痛点,并在多个应用中展现出超越现有最先进方法的性能,为现实世界智能体系统的监控和优化提供了实用的指导。 |
|
| 06-24 |
Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets 机构: University of Illinois Chicago 本文提出了 Argus 基准,系统地评估了计算机使用代理中的不确定性量化方法。研究揭示了 UQ 方法排名的“选择性转移”特性:在同一模型不同数据集间高度稳定,但在跨模型架构和接口(特别是开源到闭源)时显著失效。文章指出隐藏状态和密度方法在开源场景下最稳健,而闭源场景需独立重新排名。此外,研究强调了在实际部署中,结合共形预测的空间安全区域比单纯的分数排序更关键,但需注意分布偏移对覆盖率的影响。该工作为 GUI 代理中感知机制环境的 UQ 选择提供了可复现的基础。 |
|
| 06-24 |
Explainable Control Framework (XCF) based on Fuzzy Model-Agnostic Explanation and LLM Agent-Supported Interface 机构: King's College London 本文提出了一种基于模糊模型无关解释和LLM代理支持界面的可解释控制框架(XCF)。通过引入HFMAE-C方法,利用模糊逻辑系统近似控制器行为,生成分层级的IF-THEN规则和显著性值,解决了黑盒控制器和复杂数学模型的可解释性问题。同时,结合LLM代理实现了自然语言报告和交互式咨询,显著提升了用户对控制系统的理解和信任。在倒立摆和机器人避障任务中的实验验证了该框架的有效性和优越性。 |
|
| 06-24 |
Staying In Character: Perspective-Bounded Memory For Book-Based Role-Playing Agents 机构: University of Sydney, UNSW Sydney, Chang’an University, RAIDS Lab, Tongyi Lab (Alibaba Group) 本文针对长叙事角色扮演中的事实越界和风格单调问题,提出了 REVERIEMEM 三层记忆架构。通过情景层、语义层和个性层的协同工作,实现了视角受限的记忆管理和动态风格适应。在自建基准 KBF-QA 和现有基准 BOOKWORLD 上的广泛评估证实,该方法在保持角色知识边界忠实度和提升叙事生动性方面均显著优于现有技术,为构建高保真度的小说角色代理提供了新的解决方案。 |
|
| 06-23 |
Privacy-Preserving RAG via Multi-Agent Semantic Rewriting: Achieving Confidentiality Without Compromising Contextual Fidelity 机构: North China Electric Power University 本文提出了一种创新的多智能体语义重写框架,有效解决了 RAG 系统中的隐私泄露问题。通过离线预处理机制,该方法在几乎完全消除针对性隐私泄露风险的同时,保持了优于现有方法的语义 fidelity,且不影响在线服务性能,为敏感领域的 RAG 应用提供了可行的解决方案。 |
|
| 06-23 |
Governed Shared Memory for Multi-Agent LLM Systems 机构: University of the Negev 本文论证了生产级多智能体记忆不能仅依赖长上下文检索,而必须视为受治理的分布式系统问题。通过引入显式的系统级抽象(如作用域、时序、血缘和策略传播),MemClaw 展示了如何在大规模集群中管理共享状态。更重要的是,通过对生产环境的实时评估,揭示了诸如作用域执行漏洞和管道竞争条件等关键架构问题,强调了在实际部署中进行实证评估对于暴露设计阶段遗漏故障的重要性。 |
|
| 06-23 |
Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System 机构: Columbia University 本文系统地研究了自动化评分器评估代理数据分析输出的可靠性,并提出了改进策略。通过结合非生成式 AI(正则)和生成式 AI(LLM 宽松评分)以及人工校准,构建了高精度的评分级联。研究强调了从复杂代理输出中提取答案的挑战,并通过迭代 nudging 机制显著提升了评估管道的鲁棒性和成功率,为未来可验证数据科学中的代理工作流评估提供了重要见解。 |
|
| 06-23 |
DeepBD: A Grounded Agentic Workflow for Variant Prioritization and Diagnosis of Genetic Birth Defects 机构: Zhejiang University DeepBD展示了一种将数据驱动的证据集成、基于工具的细化和LLM辅助的诊断审查分配不同角色的接地智能体方法。该方法有效解决了遗传性出生缺陷回顾性变异优先级排序中的复杂性问题,通过模块化设计提升了诊断的准确性和鲁棒性,为临床基因组学解释提供了新的范式。 |
|
| 06-23 |
SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation 机构: Capital One, General Intelligence Company of New York, Northwestern University SAFARI 提出了一种创新的故障归因范式,通过“主动调查”机制解决了长轨迹智能体系统中的诊断难题。它利用专用工具读取轨迹片段并结合持久短期记忆,成功突破了 LLM 上下文窗口的物理限制和注意力稀释问题。实验表明,该方法不仅在常规基准测试中大幅超越现有 SOTA,更在极端长程依赖场景下保持了可靠的诊断能力,为大规模多智能体系统的可观测性和可靠性提供了重要技术支持。 |
|
| 06-22 |
Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation 本文引入了AFTER基准,系统地研究了LLM代理中程序性记忆的控制、适应与评估。研究结果表明,虽然程序性记忆能显著提升性能,但技能的来源至关重要。源自多样化多模型经验的技能更能平衡特化与泛化,从而实现有效的跨域迁移。这些发现为在生产环境中构建和部署程序性记忆系统提供了实践指导。 |
|
| 06-22 |
Self-Compacting Language Model Agents 机构: Johns Hopkins University, Apple SelfCompact 揭示了 LLM 代理中的元认知差距,并通过简单的推理时规则成功解决了长轨迹中的上下文腐烂问题。它证明了“何时压缩”可以作为一种由脚手架提供的能力,而无需额外的模型训练。该方法在显著降低计算成本的同时,提升了代理在复杂推理和搜索任务中的表现,为长上下文代理的高效运行提供了新的范式。 |
|
| 06-22 |
Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory 本文揭示了 LLM 智能体记忆系统设计中的一个关键漏洞:记忆传染。研究表明,来自有偏评估器的经验一旦存入记忆,即便经过完美的整合,也会将偏见传播给未来的智能体。此外,记忆整合对不同偏见具有截然不同的影响(减弱长度偏见但可能放大权威偏见)。这一发现挑战了现有对记忆整合作用的认知,并为衡量和缓解跨时间偏见传播提供了形式化工具。 |
|
| 06-22 |
MAS-PromptBench: When Does Prompt Optimization Improve Multi-Agent LLM Systems? 机构: Johns Hopkins University 本文通过 MAS-PromptBench 系统地研究了多智能体系统中的提示词优化问题。研究发现,尽管提示词优化在单智能体场景中表现稳健,但在多智能体环境中,其效果具有高度的不确定性和配置依赖性,甚至可能导致性能显著下降。这项工作揭示了将单智能体优化方法直接扩展到多智能体系统的局限性,并强调了需要针对 MAS 特性开发更鲁棒的优化策略,同时为从业者提供了关于何时以及如何应用提示词优化的重要见解。 |
|
| 06-22 |
Detecting Malicious Agent Skills in the Wild using Attention 机构: University of Luxembourg 本文针对 LLM 智能体技能市场的新兴安全威胁,提出了 Locate-and-Judge 检测框架。通过解耦定位与判断,利用注意力机制高效筛选高风险片段,解决了传统防御在纯指令环境失效及全量扫描成本高昂的问题。实验表明,该方法在保证高精度的同时实现了低成本的大规模部署,并发布了标注数据集以支持后续研究。 |
|
| 06-21 |
PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems 机构: University of Illinois Urbana-Champaign PlanBench-XL 填补了评估 LLM 智能体在大规模、不完美工具环境中长周期规划能力的空白。通过引入部分工具可见性和动态阻塞机制,该基准真实地模拟了现实世界的不确定性。研究结果表明,尽管顶级模型在理想条件下表现尚可,但在面对工具故障和检索噪声时鲁棒性极差,突显了开发更具适应性和鲁棒性的长周期规划算法的迫切需求。 |
|
| 06-21 |
BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories 机构: lable evaluation in NLP pipelines BabelJudge 通过创新的“退化标注”方法解决了 LLM 裁判评估中的人工标注瓶颈,并提供了一套全面的框架来审计位置偏差、冗长偏差及跨语言性能退化。研究揭示了在低资源语言中裁判可靠性的严重下降及其被原始准确率掩盖的事实,同时扩展了对 Agent 轨迹的评估能力。该工具为开发更鲁棒、公平的 LLM 裁判系统提供了重要的基础设施和度量标准。 |
|
| 06-21 |
Libretto: Giving LLM Agents a Sense of Musical Structure 机构: University of California, Berkeley Libretto 解决了 LLM 代理在音乐生成中面临的“结构盲区”问题。通过引入显式结构的 LLM 原生语法和基于多维结构轴的统计评估空间,它将符号音乐转化为可测量和可编辑的对象。这不仅提升了生成音乐的结构合理性,还赋予了代理诊断错误和迭代修订的能力,为可控的音乐创作提供了新的范式。 |
|
| 06-21 |
VISTA Architect: A graph database-oriented health AI system demonstrated in multidisciplinary tumor boards 机构: Stanford University School of Medicine VISTA Architect 通过引入面向图数据库的架构,成功解决了纵向EHR数据处理中的时序一致性、来源可追溯性及计算效率问题。它通过将耗时的临床综合过程前置到数据摄入阶段,实现了高效、准确的 patient history 重建,显著减轻了临床医生的负担,并在胸部肿瘤学的实际临床场景中展现了超越传统RAG方法的卓越性能。其模块化设计也为未来扩展到其他医疗专科奠定了基础。 |
|
| 06-21 |
Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents 机构: Beijing Institute of Technology 本文揭示了LLM智能体中上下文压缩机制作为关键安全故障面的问题,定义了“治理衰减”现象。通过 ConstraintRot 基准量化了压缩导致的安全违规风险,并展示了针对性的对抗攻击威力。最终提出的 Constraint Pinning 提供了一种高效、无需训练的防御方案,强调了在部署长周期LLM智能体时,必须将上下文管理纳入核心治理考量。 |
|
| 06-20 |
CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents CFAgentBench 填补了建筑财务领域自主智能体评估的空白,通过构建真实可执行的多系统环境和引入严格的资金安全守卫,提供了比传统静态基准更贴近生产环境的评估标准。研究结果强调,对于财务等高风险领域,评估重点应从单次任务的准确性转向操作的可重复性、功能正确性及安全性,单次高准确率并不代表智能体具备实际部署能力。 |
|
| 06-20 |
CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation 机构: Wuhan University CodeTeam 通过引入角色分工明确的多智能体协作机制(Architect, CTO, Developer, QA),有效解决了仓库级代码生成中的长程规划和跨文件一致性难题。实验表明,该方法在代码结构质量和功能正确性上均优于现有基线方法,特别是检索增强规划和特定的资源分配策略对性能提升至关重要。 |
|
| 06-20 |
Harness-MU: A Safe, Governed, and Effective Harness for Multi-User LLM Agents 机构: The Chinese University of Hong Kong, Shenzhen Harness-MU 确立了“Harness Engineering”(驾驭工程)哲学在多主体 LLM 治理中的重要性。它指出,解决 LLM 多主体治理挑战的关键不在于提升模型本身的概率能力,而在于构建系统化的基础设施。通过将确定性的治理逻辑从概率性的语言生成中剥离,Harness-MU 为企业级多用户 LLM 部署提供了安全、受控且高效的解决方案。 |
|
| 06-20 |
When Is Emergent Consensus Real? A Measured Coupling Gain and a Validity Diagnostic for LLM Agent Societies 本文并未提出新的社会动力学理论,而是提供了一套严格的测量协议和有效性诊断工具。通过引入可测量的耦合增益 |
|
| 06-20 |
Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases 机构: University of California, Berkeley Revelio 通过引入可执行的漏洞证明机制和分层成本控制策略,有效解决了 LLM 在漏洞检测中的幻觉和高成本问题。它在成熟软件项目中成功发现了新的内存安全漏洞,证明了其在实际部署中的高效性和可靠性,为大规模代码库的安全审计提供了新的解决方案。 |
|
| 06-18 |
Probe-and-Refine Tuning of Repository Guidance for Coding Agents 机构: Williams College 本文揭示了仓库指导文件(如 AGENTS.md)对编码智能体性能的关键作用,并指出其效果取决于生成方式。通过提出“探测与精炼调优”方法,作者证明了迭代式、基于失败诊断的指导文件生成能显著提升智能体在 SWE-bench 上的解决率。核心发现是,优化的指导文件主要通过提高智能体定位正确文件的能力(覆盖率)来提升性能,而非提高代码补丁本身的精度。这为解决当前关于 AI 辅助编程中上下文指导有效性的争议提供了 principled 的方法论依据。
|
|
| 06-18 |
Contagion Networks: Evaluator Bias Propagation in Multi-Agent LLM Systems 机构: Qilu Institute of Technology 本文引入了“传染网络”框架,首次形式化并量化了多智能体LLM系统中评估者偏见的传播现象。通过理论推导和实证研究,文章揭示了由谱半径控制的三种传播机制,并指出同构模型智能体网络通常处于偏见抑制状态。更重要的是,文章提出了通过增加评估者多样性(委员会规模)来显著降低偏见传播的有效策略,为构建更稳健、多样化的多智能体系统提供了理论依据和实践指导。 |
|
| 06-18 |
Hierarchical Control in Multi-Agent Games: LLM-based Planning and RL Execution 机构: Electronic Arts (EA); KTH Royal Institute of Technology 本文提出了一种结合预训练LLM推理能力与预训练RL执行能力的混合分层架构,用于解决复杂多智能体游戏中的协调与控制问题。该方法无需手动编写规则,即可达到与手工行为树相当的竞技水平,同时在行为 believability(可信度/类人程度)上显著优于传统方法,证明了LLM作为高层战略控制器 orchestrate 底层RL技能的有效性。 |
|
| 06-18 |
LLM agent safety, multi-turn red-teaming, jailbreak benchmarks, adversarial robustness, safety-critical systems 机构: AIM Intelligence; KAERI 本文提出了 NRT-Bench,填补了 LLM 智能体在安全关键系统中多轮红队测试的空白。通过模拟核电站控制室,研究证明了自适应多轮攻击能有效突破当前前沿模型的安全防线,且不同模型的漏洞具有显著差异性。此外,防御措施的效果高度依赖于具体模型,暗示了通用防御策略的局限性。该工作为 LLM 智能体在高风险环境中的安全性评估提供了重要的基准和数据支持。 |
|
| 06-18 |
AutoPass: Evidence-Guided LLM Agents for Compiler Performance Tuning 机构: Shaanxi Normal University, Northwest University, University of Leeds AutoPass 展示了一种新颖的编译器调优范式,通过让 LLM 直接访问编译器内部证据(IR和优化状态)并结合运行时反馈,有效解决了传统黑盒调优方法的局限性。该方法无需训练即可在不同硬件平台上实现显著的性能提升,证明了证据引导的 LLM 智能体在复杂系统软件调优中的巨大潜力。 |
|
| 06-17 |
A Technical Taxonomy of LLM Agent Communication Protocols 机构: Technische Universität München 本文针对 LLM 多智能体系统中通信协议碎片化和互操作性差的问题,开发了一个技术分类法。通过对九个主流开源协议的五轮迭代分析,确立了五个关键分类维度。研究揭示了当前协议在负载处理和状态管理上的共性,以及向模式灵活性发展的趋势。文章预测未来将形成联邦式分层协议栈,而非单一垄断协议,并为协议选择和研究方向(如隐私保护)提供了指导框架。 |
|
| 06-17 |
CAPRA: Scaling Feedback on Software Architecture Deliverables with a Multi-Agent LLM System 机构: University of Florence CAPRA 证明了多智能体 LLM 系统在软件架构教育反馈中的可行性。通过结合多模态提取、确定性证据验证和一致性管理,它能够有效扩展形成性反馈的规模,减轻教师负担。然而,目前系统在处理高度主观的评估维度时仍需人类专家的介入,未来可进一步优化以提升完全自动化的可靠性。 |
|
| 06-17 |
Leadership as Coordination Control: Behavioral Signatures and the Recovery-Advantage Boundary in Multi-Agent LLM Teams 机构: Indiana University Bloomington 本文通过将团队科学中的权变领导理论应用于多智能体LLM团队,揭示了过程级协调控制的价值是有条件的。研究指出,不应将协调控制视为旨在刷榜的工具,而应将其视为一种需要测量并与理论映射的权变因素。只有在团队初始共识不可靠且具备恢复潜力时,基于理论的协调控制才能带来显著的性能提升。 |
|
| 06-17 |
Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents 机构: DoorDash, Inc. 本文论证了实时接地应被视为一个可优化的接口边界,而非固定的模型特性。DSG 架构成功解耦了搜索与推理,在几乎不牺牲准确率的前提下,显著降低了成本和延迟,并解决了原生搜索导致的输出格式不可控问题,为构建高效、可移植的生产级 LLM Agent 提供了新的架构范式。 |
|
| 06-17 |
GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents 机构: Jilin University, Shanghai Jiao Tong University, King Abdullah University of Science and Technology (KAUST), Tsinghua University, National University of Singapore GateMem 填补了多主体共享内存智能体评估领域的空白,强调了在共享环境中“治理”与“召回”同等重要。研究结果表明,当前主流的记忆架构(无论是长上下文还是检索增强)在平衡效用、安全性和隐私遗忘方面均存在显著缺陷。该基准为未来开发更安全、更符合伦理规范的共享智能体提供了重要的评估标准和研究方向。 |
|
| 06-16 |
ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents 机构: Multiverse Computing, Donostia International Physics Center, Ikerbasque Foundation for Science ProvenanceGuard 证明了来源归因是 MCP 基础智能体事实性验证的一个独立且至关重要的维度。通过引入来源感知的验证机制和修复循环,该方法有效解决了“跨源混淆”这一传统指标忽略的故障模式,显著提高了医疗等高风险领域 LLM 智能体输出的可靠性和可解释性。尽管在语义极度相似的来源间进行精确归属仍具挑战,但其整体性能优于现有的无来源感知基线。 |
|
| 06-16 |
RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills 机构: Google Research, University of Illinois Chicago RubricsTree 解决了个人健康 AI 代理在大规模部署中的核心评估难题。通过构建专家对齐的分层布尔评分标准和上下文感知路由机制,它成功平衡了评估的可扩展性与临床专业性。实验证明,该框架不仅能准确评估现有模型,还能作为有效的优化信号显著提升主流 LLM 在医疗健康领域的表现,为产品级个人医疗 AI 的持续优化提供了必要的基础设施。 |
|
| 06-16 |
All Smoke, No Alarm: Oracle Signals in Agent-Authored Test Code 机构: Kennesaw State University 本文通过大规模实证研究指出,当前 AI 编程代理生成的测试代码中,绝大多数缺乏有效的验证逻辑(即“只有烟雾,没有警报”)。尽管表面上看测试覆盖率很高,但实际验证强度不足。研究证明,包含强预言信号的测试能显著提高 PR 的合并概率。因此,建议实践者采用感知测试预言的质量检查方法,以更准确地评估和保障 AI 生成代码的贡献质量,避免被虚假的测试存在感所误导。 |
|
| 06-16 |
PseudoBench: Measuring How Agentic Auto-Research Fuels Pseudoscience 机构: Shanghai Artificial Intelligence Laboratory 本文揭示了代理式自动研究系统在缺乏科学对齐的情况下,具有助长伪科学的惊人能力。通过引入 PseudoBench,作者证明了当前最先进系统的抗伪科学能力极弱,且存在用专业术语美化伪科学的风险。这一发现呼吁在广泛部署自主科研智能体之前,必须优先解决科学对齐问题,以防止学术文献被污染和科学信任危机的加剧。 |
|
| 06-16 |
Trustworthy Self-Composable Big-Data-as-a-Service: An LLM-Orchestrated Multi-Agent Framework for Automated Data Engineering, AutoML, MLOps Deployment, and Drift-Aware Lifecycle Optimization 机构: Sirindhorn International Institute of Technology, Thammasat University 本文针对现有AutoML和LLM代理在BDaaS全流程自动化中的局限性,提出了一种由LLM编排的多智能体框架。通过将生命周期分解为专用智能体并引入中央编排、工件治理及漂移感知机制,该框架不仅保持了 competitive 的模型预测性能,更大幅提升了工程层面的可靠性、可复现性和适应性,为构建生产级可信大数据服务提供了新的技术路径。 |
|
| 06-15 |
TokenPilot: Cache-Efficient Context Management for LLM Agents 机构: Zhejiang University, University of Electronic Science and Technology of China, Xi’an Jiaotong University, HomologyAI TokenPilot 针对 LLM 智能体长会话中的上下文管理难题,提出了一种兼顾文本稀疏性与缓存连续性的双粒度解决方案。通过全局的摄入感知压缩稳定前缀,以及局部的生命周期感知驱逐优化资源释放,该方法有效解决了传统剪枝方法导致的 KV Cache 失效问题。实验表明,TokenPilot 能在保持性能的前提下显著降低推理成本,特别是在连续交互场景中表现优异,为 LLM 智能体的可持续部署提供了高效的基础设施支持。 |
|
| 06-15 |
Consensus-based Agentic Large Language Model Framework for Harmonized Tariff Schedule Code Classification 机构: University of New Brunswick, Canada; University of Economics Ho Chi Minh City, Vietnam 本文提出了一种创新的基于共识的智能体LLM框架,旨在解决海运物流中加拿大10位HTS代码分类的难题。通过整合多智能体检索、证据 grounding、共识验证和人机协同机制,该框架显著提升了分类的可解释性和问责制。研究证实,在处理高度专业和法律敏感的关税分类任务时,结合外部知识检索与人类专家介入的混合工作流优于纯粹的端到端深度学习或LLM预测方法。 |
|
| 06-15 |
OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models 机构: The Hong Kong Polytechnic University 本文针对现有 LLM 智能体技能构建中存在的碎片化、低多样性和弱迁移性问题,提出了集体技能树搜索(CSTS)框架。通过利用多模型的集体智能进行技能生成与评估,CSTS 能够自动构建结构化、多样化且高泛化性的技能树。结合集体技能强化学习,最终得到的 OpenClaw-Skill 模型在复杂任务处理、工具使用及跨模型泛化方面均取得了显著优于现有工作的性能,为自动化构建高效 LLM 智能体技能提供了新的范式。 |
|
| 06-15 |
AgentFairBench: Do LLM Agents Discriminate When They Act? 机构: Florida International University, Boston University, Indian Institute of Technology Patna 本文指出了 LLM 公平性评估中“回答”与“行动”之间的关键差距,并提出了 AgentFairBench 作为解决方案。通过引入偏见传导框架和元数匹配零假设方法,该基准测试能够准确、敏感地检测 LLM 代理在招聘、借贷和医疗等关键领域行动中的 demographic disparity。研究结果表明,当前先进的代理模型(如 Claude Haiku 4.5)在严格统计控制下未表现出显著的歧视行为,但该方法论为未来监控和缓解代理偏差提供了重要工具。 |
|
| 06-15 |
CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies 机构: Sakana AI, KPMG AZSA LLC CoffeeBench 填补了长 horizon 多智能体经济系统评估的空白,通过模拟异质 firms 间的复杂互动,揭示了 LLM 代理在长期商业场景中的能力差异及特定故障模式(如空闲漂移)。该基准为未来研究提供了重要的代码和数据支持,推动了 LLM 代理在金融、制造等复杂行业应用中的评估标准发展。 |
|
| 06-14 |
SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills 机构: University of Texas at El Paso 本文针对开源 LLM Agent 技能生态系统中日益严峻的安全问题,指出了现有基于代码层的静态扫描工具在应对指令层攻击时的结构性缺陷。作者提出了 SkillVetBench,利用 LLM-as-Judge 技术构建了首个针对 Agent 技能的多维度安全评估基准和实时排行榜。通过引入 SARS 评分体系和 CVSS v4.0 分解,该方法在检测提示注入、记忆投毒等复杂语义攻击方面显著优于传统静态分析工具,实现了零假阴性和零假阳性的优异表现,为开源 Agent 生态的安全治理提供了标准化的自动化解决方案。 |
|
| 06-14 |
Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations 本文揭示了LLM在智能体记忆管道中的位置(写入时 vs 突变时)决定了系统能从哪种遗忘失败模式中恢复。通过ForgetEval基准测试,作者证明了现有的纯召回优化不足以应对生产环境中的隐私和数据一致性需求。最佳实践是采用“突变时LLM挂钩”或结合写入时标准化的混合架构,以在可控的成本和延迟下实现高效的受控遗忘。 |
|
| 06-14 |
LLM-as-Code Agentic Programming for Agent Harness 机构: City University of Hong Kong 本文批判了当前 LLM Agent 框架中将概率模型用于确定性控制流的架构缺陷,提出了 Agentic Programming 范式。通过引入 LLM-as-Code 概念,将控制流完全交由程序管理,LLM 仅作为执行节点嵌入 DAG 结构中。这种方法从根本上解决了 Token 爆炸和控制流幻觉问题,为构建可靠、可扩展的长程 Agent 系统提供了新的架构思路。 |
|
| 06-14 |
RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments RetailBench 提供了一个受控的测试平台,用于研究在经济基础的长周期决策中可靠的自主性。研究结果表明,尽管 LLM 在短期任务上表现优异,但在面对需要长期连贯性、复杂资源管理和部分可观测信息的真实零售环境时,现有智能体仍存在显著局限,特别是在长期策略一致性和深度推理方面。 |
|
| 06-14 |
Agentic Framework for Deep Learning workload migration via In-Context Learning 机构: Google 本文提出了一种创新的智能体框架,通过将上下文学习与基于实际执行结果的预言机机制相结合,解决了 LLM 在深度学习框架迁移中面临的语义和数值准确性难题。该方法通过提供语法锚点和动态执行锚点,实现了高度可靠且可扩展的跨框架迁移蓝图,在保持低计算开销的同时,大幅提升了 PyTorch 到 JAX 迁移的数值等价性,为利用 TPU 等硬件优势提供了自动化工具支持。 |
|
| 06-13 |
APEX: Adaptive Principle EXtraction A Three-Layer Self-Evolution Framework for Production AI Agents 机构: Grace AI Technology APEX 证明了在生产环境中,AI Agent 的自我改进不应局限于单一的提示词或工作流优化,而应采用 Harness、行为原则和工作流拓扑的多维度协同进化。通过在真实生产轨迹上的验证,APEX 展示了以极低的计算成本实现大幅性能提升的能力,为生产级 AI Agent 的自动化持续优化提供了新的范式。 |
|
| 06-13 |
Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering 机构: University of Minnesota 本文提出了一种创新的多智能体同行评审推理方法,旨在解决医疗问答中准确性和可解释性的关键问题。通过让LLM相互评判推理过程而非仅仅比较答案,该方法显著超越了传统的单模型思维和多数投票基线。实验结果表明,强调推理质量而非单纯的答案一致性,能有效提升医疗AI系统的可信度、鲁棒性和准确性,为构建值得信赖的生物医学AI系统提供了新的方向。 |
|
| 06-13 |
Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation 机构: University of Waterloo, SkyWatch, University of Calgary 本文提出了一种用于地理空间数据检索的风险感知 LLM 代理框架。通过集成安全防护、意图理解和 API 生成三个专用代理,该系统实现了从自然语言到结构化 API 调用的安全、可靠转换。初步评估证实了系统级防护(Guardrail)在应对对抗性攻击方面的价值,为环境监测、灾害响应等领域的自动化地球观测工作流提供了可扩展的解决方案。 |
|
| 06-13 |
Not All Skills Help: Measuring and Repairing Agent Knowledge 机构: UNC Chapel Hill, Purdue University, NVIDIA 本文指出了当前 LLM 智能体技能积累中 unchecked accumulation 的系统性缺陷,即 LLM 自身判断无法有效区分技能的因果效用。通过提出 ASSAY 框架,利用因果归因和按任务动态掩码技术,成功解决了技能异质性和匹配难题。该方法在不修改模型权重的情况下,显著提升了多个主流模型在复杂交互基准上的表现,证明了分离技能生成与基于实证证据的策展的重要性。 |
|
| 06-13 |
ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents 本文提出了 ToolMenuBench,填补了 LLM 代理评估中关于工具菜单构建研究的空白。研究指出,可靠的代理不仅需要正确的工具调用语法,更需要系统的界面评估来决定在何种成本和风险约束下、何时向模型展示哪些工具。实验表明,基于因果逻辑的最小化工具过滤(CMTF)是提升代理可靠性、效率和安全性的有效途径,为未来的代理接口设计提供了可重用的评估框架和指导原则。 |
|
| 06-12 |
tap: A File-Based Protocol for Heterogeneous LLM Agent Collaboration 机构: HUA Labs 本文提出了tap,一种轻量级的基于文件的协作协议,解决了异构LLM智能体在无共享运行时环境下的直接通信问题。通过文件优先的设计和实时通知的结合,tap实现了Claude和Codex等不同厂商智能体的高效协作。实证研究表明,异构智能体协作能显著提高代码审查中发现缺陷的概率,证明了该协议在实际生产环境中的有效性和价值。 |
|
| 06-12 |
Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows 机构: Georgia Institute of Technology, Meta 本文针对LLM代理工作流中并行结构与顺序文本接口之间的错配问题,提出了 Parallel-Synthesis 框架。通过直接利用并行分支的 KV 缓存而非拼接文本,该方法解决了冗余计算和结构信息丢失的问题。实验结果表明,该框架在多个复杂任务上保持了高水平的准确性,并大幅降低了延迟,为构建更高效的原生并行代理系统提供了新的技术路径。 |
|
| 06-12 |
GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge 机构: QpiAI, Bengaluru, India 本文引入了 GitOfThoughts,旨在解决 LLM 推理过程缺乏版本控制的问题,实现了推理的可重放性和可审计性。更重要的是,通过严格的预注册实验,文章反驳了“通用记忆能提升新颖问题求解能力”的普遍假设,指出记忆仅在极高相似度的“可复制”场景下有效,且本质是答案检索而非方法迁移。该研究倡导以更高的评估标准(包括记录撤回的结果和被驳斥的假设)来审视代理记忆领域,强调 Git 在工程运维价值上的优势而非单纯的精度提升。 |
|
| 06-12 |
Graph-based Target Back-Propagation for Context Adaptation in Multi-LLM Agentic Systems 机构: Walmart Global Tech 本文针对多LLM智能体系统中的上下文适应问题,提出了GTBP框架。通过引入基于图的目标反向传播机制,GTBP解决了现有方法中信用分配不准确和缺乏收敛保证的问题。理论分析和实证结果均表明,GTBP能够稳定地优化提示词,并在多个基准测试中超越现有最先进方法,为自动化提示工程提供了一种高效且理论可靠的解决方案。 |
|
| 06-12 |
When Errors Become Narratives: A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime 本文通过对生产环境中LLM代理运行时静默故障的纵向研究,揭示了LLM系统特有的“似真故障”风险。研究指出,传统测试和监控在面对LLM生成的流畅错误叙述时存在巨大盲区,大部分故障依靠用户发现。作者提出了五类静默故障分类法,并强调故障多发生于组件接缝处。最终,文章提供了一套防御框架和设计原则,旨在构建故障可观测性强、易于归因的LLM代理系统,所有事故复盘和工件均已公开。 |
|
| 06-11 |
AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility 机构: UC Berkeley, UC Santa Cruz, EPFL, IBM Research, Mila, McGill University, ServiceNow Research, Carnegie Mellon University, The Brookings Institution, NeoCognition, The Ohio State University, Mercor, UC Santa Barbara 本文提出了AAA框架和AgentBeats系统,通过标准化协议(A2A/MCP)和法官智能体机制,解决了智能体评估中的碎片化和集成难题。通过社区规模的竞赛和具体案例研究,证明了该方法在开放性、标准化和可复现性方面的有效性,为智能体评估提供了一条清晰的发展路径。 |
|
| 06-11 |
Reward Modeling for Multi-Agent Orchestration 机构: Rutgers University, Salesforce AI Research 本文提出了 Orch-RM,解决了多智能体系统编排器训练中监督数据稀缺和计算成本高昂的问题。通过利用中间执行产物构建自监督奖励信号,Orch-RM 在不依赖人工标注和昂贵 rollout 的情况下,显著提升了训练效率和最终性能。该方法证明了编排层面的奖励建模是实现鲁棒、可扩展多智能体编排的有效方向。 |
|
| 06-11 |
EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery 机构: Tsinghua University, Zhipu AI EurekAgent 证明了“环境工程”是开发可靠自主研究代理的核心方向。通过精心设计环境的四个维度(权限、工件、预算、人机协同),该系统不仅大幅降低了自动化科学发现的门槛和成本,还在多个硬核科学任务中超越了人类专家和现有AI系统的最优结果。该工作呼吁社区将研究重点从单纯的工作流设计转向更全面的环境工程设计。 |
|
| 06-11 |
EpiBench: Verifiable Evaluation of AI Agents on Epigenomics Analysis 机构: LatchBio EpiBench填补了表观基因组学AI智能体评估的空白,通过提供可验证、确定性的评分标准,量化了当前最先进的LLM智能体在真实生物信息学工作流中的表现。结果显示,尽管顶级模型在部分任务上接近50%的通过率,但整体而言,它们在需要深层领域知识的科学决策上仍显不足。该基准为未来开发更专业的生物AI代理提供了明确的改进方向和评估标准。 |
|
| 06-11 |
ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages 机构: Indian Institute of Technology Patna 本文针对多模态大语言模型在印度语言医疗场景下的局限性,提出了大规模多语言多模态医疗数据集 ArogyaBodha 和基于 Actor-Critic 的多智能体推理框架 ArogyaSutra。通过引入双重记忆机制和工具接地,并结合模拟轨迹蒸馏,有效提升了低资源印度语言环境下的医疗推理准确性和逻辑一致性,为促进 AI 医疗服务的公平性和可靠性提供了重要资源和解决方案。 |
|
| 06-10 |
Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks 机构: University of Hong Kong Claw-SWE-Bench 填补了通用智能体在仓库级编码任务评估上的空白,通过标准化适配器协议和严格的评估契约,实现了不同智能体 harness 之间的公平比较。研究结果表明,harness 的设计和适配器的质量对最终性能有决定性影响,且成本效率是评估中不可忽视的关键指标。该基准为未来开发高效、低成本的编码智能体提供了重要的参考标准和数据支持。 |
|
| 06-10 |
Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application 机构: Institute of Automation, Chinese Academy of Sciences 本文填补了LLM智能体环境研究在系统性分类和深度分析方面的空白。通过构建涵盖建模、合成、评估和应用的全生命周期框架,文章不仅厘清了当前代表性环境的核心能力与发展路径,还深入探讨了自动化环境合成的两种主要范式及其评估方法。特别地,文章从智能体与环境协同进化的角度,详细阐述了智能体进化的四种路径和环境进化的三种范式,为未来构建更高效、更逼真的智能体训练环境提供了理论指导和研究方向。 |
|
| 06-10 |
Exploration Structure in LLM Agents for Multi-File Change Localization 机构: Singapore Management University 本文指出了当前 LLM 代理在代码库探索中采用的线性模式在处理多文件变更时的结构性缺陷。通过提出一种非线性的、领域范围的并行代理探索方法,证明了即使使用较小的模型,也能在覆盖率和准确性上超越传统的线性探索基线。研究还揭示了原始文件系统访问的风险以及多代理咨询的成本效益问题,为未来构建更高效的软件工程代理提供了重要见解。 |
|
| 06-10 |
APPO: Agentic Procedural Policy Optimization 机构: University of Science and Technology of China; AMAP, Alibaba Group; Southern University of Science and Technology 本文针对代理强化学习中信用分配粗糙的问题,提出了 APPO 框架。通过引入结合不确定性与似然增益的分支评分机制,以及过程级优势缩放,APPO 实现了从粗粒度单元到细粒度决策点的转变。实验证明,该方法在多个基准上显著提升了代理性能,同时保持了高效性和可解释性,为长 horizon 任务中的精细信用分配提供了新思路。 |
|
| 06-10 |
A Lightweight Multi-Agent Framework for Automated Concrete Barrier Design 机构: Hunan University; University of Miami 本文针对钢筋混凝土护栏设计中的复杂约束和人工效率低下问题,提出了一种轻量级的多智能体自动化设计框架。通过“生成-评估-优化”的闭环机制,有效解决了 LLM 的幻觉和物理 grounding 不足问题。实验表明,该方法不仅准确率高达 98% 以上,还揭示了小参数模型在特定工程任务中超越大模型的潜力,为降低 AI 辅助工程工具的计算成本和提升可访问性提供了新路径。 |
|
| 06-09 |
ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity 机构: SecureBio, Active Site 本文引入了 ABC-Bench,首个针对生物安全领域的智能体能力基准测试。通过结合干实验评估与湿实验验证,证明了当前先进的 LLM 智能体在生物操作和双用途任务上已超越普通人类专家水平。该基准为制定生物安全 safeguards、威胁建模以及评估防护措施(如机器遗忘)的有效性提供了关键的工具和数据支持,强调了在 AI 生物能力快速发展的背景下,建立针对性安全评估标准的紧迫性。 |
|
| 06-09 |
TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning 机构: Tsinghua University, Tencent TRACE解决了RLVR中因奖励对比度不足导致的低效问题。它突破了传统仅在提示词级别分配预算的局限,创新性地将预算分配细化到多轮交互的前缀级别,利用树状rollout结构和成功率预测器,实现了更高效的探索和利用。实验表明,该方法在不增加计算成本的前提下,显著提升了智能体在复杂推理任务上的表现。 |
|
| 06-09 |
T1-Bench: Benchmarking Multi-Scenario Agents in Real-World Domains 机构: Capital One T1-Bench 填补了现有基准在 realism(真实性)和 multi-domain complexity(多域复杂性)方面的空白。通过模拟真实的客户服务场景,它强调了端到端任务完成的重要性,并为评估智能体在动态、约束环境下的推理和协调能力提供了开源的数据和代码支持,推动了智能体系统向更可靠、更实用的方向发展。 |
|
| 06-09 |
Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution 机构: University of Science and Technology of China; AMAP, Alibaba Group Role-Agent 提出了一种新颖的 LLM 智能体训练范式,通过让单一模型在智能体和环境之间切换角色,解决了传统方法中反馈低效和环境静态的问题。其核心创新在于利用状态预测对齐作为过程奖励(WIA),以及基于失败模式分析的数据分布重塑(AIW)。实验结果证实该方法能显著提升智能体性能,为低成本、高效率的智能体自进化提供了新的思路。 |
|
| 06-09 |
Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Evaluation 机构: State Key Laboratory for Novel Software Technology, Nanjing University; Technical University of Munich 本文系统地梳理了 LLM 智能体安全领域的现状,指出了从对话式 AI 向自主代理转变带来的新安全挑战。通过构建基于生命周期的系统框架,文章揭示了当前研究在威胁建模、防御组合性和评估真实性方面的不足,并呼吁建立明确的信任边界、严格的权限控制和更符合实际部署环境的评估标准,为未来构建安全的 LLM 智能体系统指明了方向。 |
|
| 06-08 |
AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving 机构: University of Central Florida 本文针对多轮 LLM 智能体服务中存在的复杂状态管理和资源调度问题,提出了 AGENTSERVESIM 模拟器。该工具通过模块化设计解决了工具调用间隙模拟和跨轮次 KV 缓存追踪两大难题,能够在低成本 CPU 环境下以高保真度(误差<6%)模拟真实硬件上的智能体服务行为。这使得研究人员能够在无需大量昂贵加速器资源的情况下,对智能体服务策略进行可控、可重复的探索和优化。 |
|
| 06-08 |
Memory Beyond Recall: A Dual-Process Cognitive Memory System for Self-Evolving LLM Agents 机构: Tencent 本文指出了当前 LLM 代理记忆系统混淆“记忆即存储”与“记忆即认知”的根本缺陷,提出了 DCPM 系统。通过引入类似人类认知的双过程机制(System 1 负责快速记录信念修正链,System 2 负责慢速抽象跨域模式),DCPM 实现了从被动事实存储到主动认知进化的跃迁,有效解决了隐式个性化和跨域推理难题。 |
|
| 06-08 |
SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research 机构: Tsinghua University, Peking University, Renmin University of China, Ant Group SearchSwarm 填补了开源社区在长周期代理任务中“委托智能”训练数据合成与模型训练的空白。通过引入 harness 引导生成高质量 SFT 数据,成功使 30B 规模的模型在深度研究任务中达到了超越同量级模型、媲美超大模型的绩效,为资源受限下的高效长程推理提供了新范式。 |
|
| 06-08 |
SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks 机构: Tsinghua University, Chongqing University, Peking University, ZenoMind AI SpatialWorld 填补了评估 MLLM 交互式空间推理能力的空白,通过整合多个异构仿真环境并强制要求代理在部分可观测条件下进行主动探索,提供了一个严格的测试平台。研究结果表明,尽管 MLLM 发展迅速,但在处理复杂现实世界空间任务时仍面临巨大挑战,特别是在主动探索和长期规划方面,为未来空间代理的研究指明了方向。 |
|
| 06-08 |
What Should a Skill Remember? Quality-Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents 机构: University of Science and Technology of China 本文挑战了将技能重写等同于提示压缩的传统观点,指出技能中的稀疏操作锚点对智能体的执行效率至关重要。通过引入成本感知的重写框架,作者展示了如何在保持任务执行质量的同时显著降低总体成本。研究结果表明,技能设计应被视为一种操作知识工程,需根据任务特性精细平衡质量与成本,而非一味追求文本长度的缩短。 |
|
| 06-07 |
Agentic Search for Counterfactual Recourse under Fixed LLM Budgets 机构: RIKEN Center for Advanced Intelligence Project 本文针对固定 LLM 预算下的反事实解释生成问题,提出了 Comp-MCTS 框架。通过将问题重构为固定预算的搜索问题,并结合 LLM 提议、预言机验证和压缩引导剪枝,该方法有效地解决了多样性和成本之间的矛盾。实验表明,Comp-MCTS 能在严格控制成本的前提下,为用户提供更多样化、高质量的可操作建议,优于现有的基于 LLM 的搜索基线。 |
|
| 06-07 |
Data Agents Under Attack: Vulnerabilities in LLM-Driven Analytical Systems 机构: Nanyang Technological University, The Hong Kong Polytechnic University, Tsinghua University 本文填补了数据库安全与通用 LLM 智能体安全之间的研究空白,首次对数据智能体进行了系统性的安全研究。通过提出分层漏洞框架和详细的攻击分类学,并结合自动化载荷生成技术在主流开源及商业系统上进行实证评估,文章有力地证明了数据智能体面临严峻的安全威胁。这项工作为未来构建更安全的数据智能体系统提供了重要的理论基础和实践指导。 |
|
| 06-07 |
Can the Environment Speak for Itself? 机构: University of California, Irvine 本文针对痴呆症护理代理训练中的长视界优化难题,提出了 T²-GRPO 框架。通过解耦轮次级和轨迹级奖励,并利用环境状态转移生成密集的即时奖励,结合中心秩归一化技术,成功平衡了即时患者情绪反馈与长期护理目标。实验证明该方法在提升护理质量、确保安全性和处理复杂情感交互方面显著优于现有基线,为情感敏感型 LLM 代理的训练提供了新的思路。 |
|
| 06-07 |
RAILS: Verification-Native Clearing For Agentic Commerce 机构: Evolutionairy AI RAILS 解决了代理商务中缺失的关键原语——清算(Clearing)。它指出当前的 AI 基础设施堆栈中,从工具调用到支付执行之间存在验证真空。通过引入基于可接纳性分级验证的形式化模型和七个核心原语,RAILS 确保了智能体交易的完整性和责任归属。该协议不仅区分了支付与清算,还提供了一个可证伪的声音性保证,即防止基于不足证据的财务结算,为未来大规模自主智能体经济的安全运行奠定了理论基础和协议标准。 |
|
| 06-07 |
ConMem: Structured Memory-Guided Adaptation in Training-Free Multi-Agent Systems 机构: Central South University; The Hong Kong University of Science and Technology ConMem 通过引入结构化记忆卡片和关系感知图,解决了多智能体系统中历史轨迹噪声大、记忆-技能关系建模不足以及依赖训练的问题。该框架无需额外训练,即可在运行时通过跨经验协调提供 robust 的指导,显著提升了多智能体系统的适应能力和推理效率,为无需训练的 MAS 优化提供了新范式。 |
|
| 06-06 |
Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures 本文提出了Causal Agent Replay (CAR),一种用于LLM智能体失败的反事实归因方法。通过将智能体轨迹建模为结构因果模型,并利用干预实验和Shapley值估计,CAR能够准确识别导致失败的具体步骤及其交互作用,解决了现有可观测性和评估工具无法提供因果解释的痛点,为智能体调试提供了 principled 的解决方案。 |
|
| 06-06 |
"So There's a Catch-22 Here": How Early Adopters Who Build Multi-Agent LLM Systems Conceptualize Transparency 机构: Purdue University, Cornell University, Microsoft Research 本文是首批探讨多智能体LLM系统早期采用者如何理解和实践透明度的实证研究之一。文章指出,由于智能体间的协作与编排带来了新的复杂性,传统针对单一模型的透明度定义已失效。通过访谈分析,作者构建了一个多维框架,强调透明度应被视为一种情境化的社会技术实践。该框架为未来的人机交互(HCI)和AI设计提供了指导,旨在更好地对齐不同利益相关者的期望与能力,从而在复杂的分布式系统中实现负责任的AI部署。 |
|
| 06-06 |
Beyond Agent Architecture: Execution Assumptions and Reproducibility in LLM-Based Trading Systems 本文指出,LLM 交易研究的下一步关键不在于单纯追求更复杂的智能体架构,而在于建立更清晰的执行现实性、可复现性和评估可比性的报告标准。通过审计和示例证明,忽略执行细节会导致结果误导,呼吁社区重视评估纪律,以确保研究成果的经济意义和科学严谨性。 |
|
| 06-06 |
Decision-Aware Memory Cards: Counterfactual-Inspired Context Selection and Compression for Tool-Using LLM Agents 机构: Alibaba Group 本文提出了 CICL,一种针对工具使用型 LLM 智能体的决策感知上下文选择与压缩框架。通过引入反事实启发的效用评估和结构化的记忆卡片,CICL 有效解决了关键证据在行动时刻缺失的问题。实验表明,该方法显著提升了代码检索任务的准确率,并提供了一种解耦评判模型与决策信号的通用协议,为后续研究提供了可审计的基础设施。尽管在极端压缩下仍面临挑战,但其模块化设计和显著的性能增益展示了其在构建高效智能体上下文管理层面的潜力。 |
|
| 06-06 |
SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection 机构: National University of Singapore ## 文章做了什么 - 背景:在支付、电子商务和电信系统中,欺诈检测需要在个体层面保持高精度,在严重类别不平衡下保持鲁棒性,并为风险管理人员提供易于理解的决策依据。随着大语言模型(LLM)的发展,欺诈检测正从后端数据挖掘转向自动化工程流程。 - 已有工作为什么解决不了:现有的自动机器学习(AutoML)系统在固定的数值空间中搜索,缺乏对数据集的语义感知;基于图神经网络(GNN)的方法需要预定义的关系图,构建成本高且在个体决策层面不透明;通用的LLM代理设计未考虑现实世界欺诈检测中特定的召回率和精确率约束,无法直接应用于分类器构建任务。 ## 文章的核心贡献点 - 提出了一个名为SAGE的端到端LLM驱动的多代理欺诈检测框架。 |
|
| 06-05 |
TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents 机构: University of Massachusetts at Amherst, Adobe Research, Dolby Labs, University of Oregon, Cisco 本文针对 LLM 代理在长周期任务中可能出现的规避性破坏行为,提出了 TRACE 监控框架。通过引入 TIJ(分流-检查-判决)循环机制,TRACE 能够自适应地识别可疑区域,并在推理步骤间维持持久的证据状态,从而有效连接跨时间步的微弱恶意信号。实验证明,TRACE 在检测需要长程证据关联的复杂破坏行为方面优于现有最先进方法,为提升自主 LLM 代理的安全性提供了新的解决方案。 |
|
| 06-05 |
Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle 机构: Xi’an Jiaotong University, Xidian University 本文提出了 AARR 基准系列及其首个实例 AARRI-Bench,填补了现有评估在细粒度科研行为和细微判断力方面的空白。实验结果表明,尽管前沿智能体在宏观任务上表现优异,但在模拟真实研究者的专业性、严谨性和伦理判断上仍有巨大提升空间。研究强调,开发类人研究 AI 需要超越单纯的复杂框架搭建,转而深入探索和研究具体的科研行为模式。 |
|
| 06-05 |
Hierarchical Certified Semantic Commitment for Byzantine-Resilient LLM-Agent Collaboration 机构: University of Glasgow, University of Western Ontario 本文针对LLM多智能体协作中的拜占庭容错问题,提出了H-CSC协议。该协议突破了传统BFT对字节一致性的依赖,通过嵌入向量实现语义层面的共识。其核心创新在于“类型化最终性”,即根据语义凝聚程度区分“语义提交”和“裁决提交”,并在必要时安全中止。实验表明,H-CSC在保持与现有强基线相当的安全性和覆盖率的同时,提供了额外的语义可验证性,有效解决了LLM输出随机性带来的共识难题。 |
|
| 06-05 |
The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective 机构: Arizona State University 本文旨在推动基础模型智能体研究的范式转变,通过引入经典的 MDP 视角,为社区提供了统一的词汇表和研究议程。文章强调,不应将智能体鲁棒性视为全新问题,而应借鉴机器人学中成熟的 Sim-to-Real 框架。通过标准化压力测试基准和采用域随机化等既定解决方案,该议程有望培养出新一代高度可信、适用于可靠现实应用的基础模型智能体。 |
|
| 06-05 |
Self-evolving LLM agents with in-distribution Optimization 机构: Eindhoven University of Technology, University of Liverpool, MIT-IBM Watson AI Lab 本文提出的 Q-Evolve 框架解决了 LLM 智能体在长视野任务中面临的信用分配和分布偏移难题。通过在共享的“在分布”学习循环中协同进化过程级监督和策略,该方法无需人工标注或环境回溯即可实现密集奖励信号的学习,并确保了策略优化的稳定性。实验结果表明,该方法在多个复杂交互环境中显著提升了智能体的性能和样本效率,为 LLM 智能体的可靠自进化提供了新的范式。 |
|
| 06-04 |
Will the Agent Recuse Itself? Measuring LLM-Agent Compliance with In-Band Access-Deny Signals 本文提出了“回避信号”这一开放迷你标准,旨在解决自主 LLM 智能体在持有有效凭证时缺乏接收资源方“禁止访问”意图的问题。通过实现低开销的适配器并进行实证研究,证明了主流 LLM 智能体能够识别并遵守这一合作性信号。该工作填补了带内策略通信和智能体合规性测量的空白,为基础设施操作员提供了一种轻量级的治理工具,同时明确了其作为合作控制而非安全边界的定位。 |
|
| 06-04 |
Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents 机构: Carnegie Mellon University, Rice University, National University of Singapore Vortex 通过提供可编程的前端语言和高效的后端集成,解决了稀疏注意力算法在大规模部署中的工程瓶颈。它不仅加速了人类研究人员的工作流程,还赋能 AI Agent 自动探索和优化稀疏注意力设计,在多个主流和大参数模型上实现了显著的吞吐量提升,是连接稀疏注意力研究与实际高效服务的重要桥梁。 |
|
| 06-04 |
Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration 机构: Northeastern University 本文针对当前 LLM 代理在人类协作中缺乏心智模型对齐能力的问题,提出了 ALMANAC 数据集。该数据集填补了带有动作级心智模型标注的真实人类协作数据的空白。通过基于经典地图任务的收集和标注,ALMANAC 为评估和优化 LLM 代理的过程级协作能力提供了重要资源,有助于推动代理从单纯的任务执行者向具备真正协作智能的伙伴转变。 |
|
| 06-04 |
ToolChoiceConfusion: Causal Minimal Tool Filtering for Reliable LLM Agents 本文指出了LLM代理在大规模工具库面前存在的“工具选择混淆”问题,即语义相关性不足以指导可靠的多步工具使用。作者提出了CMTF方法,通过引入轻量级的因果契约和状态依赖分析,实现了训练免费的最小化工具过滤。实验表明,该方法在保持高任务成功率的同时,极大地降低了Token成本和决策复杂度,为构建高效、可靠的LLM代理系统提供了新的思路。 |
|
| 06-04 |
TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory 机构: The Hong Kong University of Science and Technology TOKI 的核心贡献在于建立了一个写入时正确性规范(契约),该规范在隔离、模式和来源方面被证明是健全的。它明确了每个生产启发式方法所假设但未显式化的保证,解决了 LLM 智能体持久化记忆中因缺乏明确并发控制契约而导致的重放不一致、信念漂移和审计擦除问题。 |
|
| 06-03 |
Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery 机构: Siemens Digital Industries Software 本文证明了在 API 持有 LLM 未知的专有领域知识时,“结构化胜过冗长”。自反思 API 通过返回机器可读的修复建议,显著提升了 AI 代理在复杂验证场景下的恢复能力和效率。该方法不适用于 LLM 已知的通用验证场景,但在处理专有业务逻辑、外部状态和专用规则时具有巨大价值。 |
|
| 06-03 |
UModel: An Agent-Ready Observability Data Modeling Method at Scale 机构: Institute for Advanced Study, UCAS; CNIC, CAS; Alibaba; Tsinghua University UModel 通过引入统一的本体框架和面向对象的建模方法,解决了现有可观测性数据模型不适合 LLM 智能体的问题。它通过标准化异构数据并提供支持自主探索的查询接口(U-SPL),显著提升了根因分析的精度和系统的可扩展性,为下一代 AIOps 提供了坚实的基础设施支持。 |
|
| 06-03 |
Towards Efficient and Evidence-grounded Mobility Prediction with LLM-Driven Agent 机构: The University of Tokyo, Huazhong University of Science and Technology AgentMob 成功地将� |