中文

Auto-Eval Judge:面向任务完成评估的通用智能体框架

人工智能 2025-08-08 v1

摘要

基石模型作为智能体在越来越多的领域得到广泛应用, necessitates 一个稳健的评估框架。当前方法如 LLM-as-a-Judge 只关注最终输出,忽略了驱动智能体决策的逐步推理过程。而现有的 Agent-as-a-Judge 系统通常设计用于狭窄、领域特定的场景。为填补这一差距,我们提出了一个通用、模块化的框架,用于独立于任务领域的智能体任务完成评估。该框架通过将任务分解为子任务并使用可用信息(如智能体的输出和推理过程)来验证每一步,从而模拟人类的评估方式。每个模块都为评估过程的特定方面做出贡献,其输出被聚合以产生对任务完成情况的最终判断。我们通过在两个基准测试(GAIA 和 BigCodeBench)上评估 Magentic-One Actor Agent 来验证该框架。我们的 Judge Agent 预测任务成功的能力在与 GPT-4o 基于的 LLM-as-a-Judge 基线相比,分别提高了 4.76% 和 10.52% 的对齐准确率。这表明了我们所提出通用评估框架的潜力。

关键词

引用

@article{arxiv.2508.05508,
  title  = {Auto-Eval Judge: Towards a General Agentic Framework for Task Completion Evaluation},
  author = {Roshita Bhonsle and Rishav Dutta and Sneha Vavilapalli and Harsh Seth and Abubakarr Jaye and Yapei Chang and Mukund Rungta and Emmanuel Aboah Boateng and Sadid Hasan and Ehi Nosakhare and Soundar Srinivasan},
  journal= {arXiv preprint arXiv:2508.05508},
  year   = {2025}
}