DEBATE:基于魏鬼论者的评估与文本评估
计算与语言
2024-05-27 v2 人工智能
摘要
随着自然语言生成(NLG)模型的流行,系统性地评估机器生成文本的质量变得越来越重要。最近的研究引入基于大语言模型的评估器,作为无参考的评估指标,展示了其在处理新任务方面的能力。然而,这些模型通常依赖单智能体方法,我们认为这引入了其性能的内在限制。这是因为大语言模型代理响应中存在偏见,包括对特定文本结构或内容的偏好。在本工作中,我们提出了DEBATE——一个基于魏鬼论者概念增强的多智能体评分系统用于NLG评估。在该框架中,一个代理被指示批评其他代理的论点,从而可能解决大语言模型代理答案中的偏见。DEBATE在两个关于NLG评估的元评估基准测试中(SummEval和TopicalChat)中显著优于以往最先进方法。我们还展示了代理之间辩论的广泛性以及代理的角色人设对评估器性能的影响。
引用
@article{arxiv.2405.09935,
title = {DEBATE: Devil's Advocate-Based Assessment and Text Evaluation},
author = {Alex Kim and Keonwoo Kim and Sangwon Yoon},
journal= {arXiv preprint arXiv:2405.09935},
year = {2024}
}