中文

LifelongAgentBench:评估 LLM 智能体作为终身学习者的基准

人工智能 2025-06-02 v3

摘要

终身学习对于在动态环境中运行的智能体至关重要。然而,当前基于大语言模型(LLM)的智能体仍然是无状态的,无法在时间维度上积累或迁移知识。现有的基准测试将智能体视为静态系统,无法评估其终身学习能力。我们提出了 LifelongAgentBench,这是第一个专为系统评估 LLM 智能体终身学习能力而设计的统一基准测试。它提供了跨三个交互式环境(数据库、操作系统和知识图谱)的技能 grounding、相互依赖任务,具有自动标签验证、可重复性和模块化可扩展性。大量实验表明,传统的经验回放在 LLM 智能体中效果有限,原因在于无关信息和上下文长度限制。我们进一步引入了群体自洽机制,显著提高了终身学习性能。我们希望 LifelongAgentBench 能推动自适应、具备记忆能力的 LLM 智能体的发展。

关键词

引用

@article{arxiv.2505.11942,
  title  = {LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners},
  author = {Junhao Zheng and Xidi Cai and Qiuke Li and Duzhen Zhang and ZhongZhi Li and Yingying Zhang and Le Song and Qianli Ma},
  journal= {arXiv preprint arXiv:2505.11942},
  year   = {2025}
}

备注

Project Page: https://caixd-220529.github.io/LifelongAgentBench/