中文

AutoLibra:从开放式人类反馈中归纳智能体度量

人工智能 2025-10-31 v3 计算与语言 机器学习

摘要

智能体主要通过任务成功度量进行评估和优化,这些度量是粗粒度的,依赖于专家的手动设计,并且无法奖励中间涌现的行为。我们提出了 **AutoLibra**,一个用于智能体评估的框架,它将开放式的人类反馈(例如,“如果你发现按钮被禁用,不要再点击它”,或者“这个智能体有太多的自主权来决定自己做什么”)转化为用于评估智能体轨迹中细粒度行为的度量。AutoLibra 通过将反馈与智能体的行为进行对齐、对相似的正向和负向行为进行聚类,并创建具有明确定义和具体示例的具体度量来实现这一点,这些度量可用于提示 LLM-as-a-Judge 作为评估器。我们进一步提出了两个元度量来评估一组(归纳出的)度量与开放式反馈的一致性:“覆盖率”和“冗余度”。通过优化这些元度量,我们通过实验证明了 AutoLibra 能够归纳出比先前智能体评估基准中提出的度量更具体的智能体评估度量,并发现用于分析智能体的新度量。我们还展示了 AutoLibra 在智能体改进中的两个应用:首先,我们展示了 AutoLibra 可以服务于人类提示工程师,用于诊断智能体失败并迭代改进提示。此外,我们发现 AutoLibra 可以归纳出用于智能体自动优化的度量,这使得智能体能够通过自我调节进行改进。我们的结果表明,AutoLibra 是一个强大的、与任务无关的工具,用于评估和改进语言智能体。

关键词

引用

@article{arxiv.2505.02820,
  title  = {AutoLibra: Agent Metric Induction from Open-Ended Human Feedback},
  author = {Hao Zhu and Phil Cuvin and Xinkai Yu and Charlotte Ka Yee Yan and Jason Zhang and Diyi Yang},
  journal= {arXiv preprint arXiv:2505.02820},
  year   = {2025}
}

备注

https://github.com/Open-Social-World/autolibra