中文

估计语言模型智能体的赋能

人工智能 2026-05-29 v3 机器学习

摘要

随着语言模型(LM)智能体变得越来越强大并被实际应用所采用,对超越昂贵的手工设计基准的可扩展评估框架的需求日益增长。我们提出基于赋能的信息论评估,赋能是一种信息论度量,用于衡量智能体通过其行动对未来状态的影响。为了处理基于文本环境的独特挑战,我们引入了EELMA(Estimating Empowerment of Language Model Agents),一种从多轮文本交互中近似有效赋能的算法。我们在文本游戏以及现实的网络和工具使用环境中展示了EELMA,表明赋能与平均任务性能强相关。我们进一步分析了赋能如何在不同模型、环境复杂度和智能体配置之间变化,并表明高赋能状态和行动通常标志着通用能力的关键时刻。这些结果确立了赋能作为一种与目标无关的度量,它补充了LM智能体评估中的任务成功度量。

关键词

引用

@article{arxiv.2509.22504,
  title  = {Estimating the Empowerment of Language Model Agents},
  author = {Jinyeop Song and Jeff Gore and Max Kleiman-Weiner},
  journal= {arXiv preprint arXiv:2509.22504},
  year   = {2026}
}

备注

Published at the International Conference on Machine Learning (ICML) 2026. 9 pages, 9 figures; camera-ready version