中文

ScaleEval:基于智能体辩论评估大型语言模型的可扩展元评估框架

计算与语言 2024-01-31 v1 人工智能

摘要

尽管大型语言模型(LLM)在广泛的任务和场景中具有实用性,但开发可靠的方法来跨越各类情境对 LLM 进行评估仍然具有挑战性。现代评估方法常常使用 LLM 来评估由 LLM 生成的响应,但这些 LLM 作为评估器的有效性进行的元评估通常受限于现有基准的覆盖范围,或需要大量的人工标注。这凸显了需要一种可扩展的元评估方法,以在 diverse tasks and scenarios(尤其是可能的新场景和用户自定义场景)中有效、可靠且高效地评估 LLM 作为评估器的性能的迫切需求。为填补这一空白,我们提出 ScaleEval,一种基于智能体辩论的元评估框架,利用多个交互式 LLM 智能体的能力。该框架支持多轮讨论,以帮助人类标注员辨别出最具潜力的 LLM 作为评估器,从而显著减轻标注员在需要大规模标注的元评估情境中的工作负担。我们公开了该框架的代码,地址为:\url{https://github.com/GAIR-NLP/scaleeval}。

关键词

引用

@article{arxiv.2401.16788,
  title  = {Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate},
  author = {Steffi Chern and Ethan Chern and Graham Neubig and Pengfei Liu},
  journal= {arXiv preprint arXiv:2401.16788},
  year   = {2024}
}