中文

多智能体即评委:将基于 LLM 智能体的自动评估与多维人类评估对齐

计算与语言 2025-07-29 v1

摘要

几乎所有人类工作都是协作完成的;因此,对真实世界 NLP 应用的评估通常需要与不同人类视角对齐的多个维度。由于真实人类评估者资源通常稀缺且昂贵,新兴的“LLM-as-a-judge”范式为利用 LLM 智能体可信地模拟人类评估者提供了一种有前景的方法。然而,迄今为止,现有的 LLM-as-a-judge 方法面临两个局限性:智能体的人格描述通常是任意设计的,且这些框架难以泛化到其他任务。为了应对这些挑战,我们提出了 MAJ-EVAL,一个多智能体即评委的评估框架,能够从相关文本文档(例如研究论文)中自动构建具有不同维度的多个评估者人格,用这些人格实例化 LLM 智能体,并组织多智能体组内辩论以生成多维反馈。我们在教育和医疗领域的评估实验表明,与传统的自动评估指标和现有的 LLM-as-a-judge 方法相比,MAJ-EVAL 生成的评估结果能更好地与人类专家的评分对齐。

关键词

引用

@article{arxiv.2507.21028,
  title  = {Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation},
  author = {Jiaju Chen and Yuxuan Lu and Xiaojie Wang and Huimin Zeng and Jing Huang and Jiri Gesi and Ying Xu and Bingsheng Yao and Dakuo Wang},
  journal= {arXiv preprint arXiv:2507.21028},
  year   = {2025}
}