中文

立即询问,后期使用:衡量长期LLM代理的主动性差距

计算与语言 2026-05-29 v2

摘要

长期LLM代理(如OpenClaw)通过在多个会话中响应用户的偏好和约束来创造价值,而不仅仅是当前请求。然而,今天的代理保留用户提供的事实,却很少询问未言明的事情,这导致长期LLM代理之间存在主动性差距:代理无法对从未获取的偏好进行行动。随着用户将更多事务委托给代理, 这一差距的影响将变得更加重要。我们将这一差距的一个具体、可控的切片隔离为Ask-to-Remember (ATR):代理决定是否在当前任务不需要但同一用户的后续会话中需要的可重用用户偏好方面进行询问。ATR即使容易评估:正确的问题是欠给定的,其回报延迟到可能永远不会出现的任务。ATRBench(据我们所知,第一款ATR基准)通过将每个用户的偏好固定为隐藏的真实情况来实现可衡量性,以成功要求提问,而非记忆。对于八个前沿LLM代理, 默认值至少在获得相关偏好后比准则差62分,提示措施几乎没有缓解。这一差距的诊断工具识别了获取作为瓶颈。ATRBench 揭示了当前代理之间的主动性差距,并为关闭该差距提供了诊断测试台。

关键词

引用

@article{arxiv.2605.28108,
  title  = {Ask Now, Use Later: Benchmarking the Proactivity Gap in Long-Lived LLM Agents},
  author = {Bin Wu and Guanyun Zou and Bingbing Wang and Huan Zhao and Chuan Shi},
  journal= {arXiv preprint arXiv:2605.28108},
  year   = {2026}
}