中文

大型语言模型作为自动对话评估器有效性的全面分析

计算与语言 2024-01-23 v2

摘要

自动评估是对话系统研究的重要组成部分。传统的基于参考的NLG指标通常被认为不适合对话评估。因此,最近的研究提出了各种独特的、无参考的神经指标,这些指标与人类评估更一致。值得注意的是,大型语言模型(LLM),特别是经过指令微调的变体如ChatGPT,被证明是有希望替代人类评判的。然而,现有关于利用LLM进行自动对话评估的工作在元评估数据集数量、评估模式、LLM覆盖范围等方面有限。因此,这些LLM的有效性仍无定论。为此,我们对LLM在自动对话评估中的应用进行了全面研究。具体来说,我们分析了30个最近出现的LLM在轮次和对话级别的多维评估能力,使用了12个元评估数据集。此外,我们探究了LLM在处理轮次和对话级别的各种对抗性扰动时的鲁棒性。最后,我们探讨了模型级和维度级集成如何影响评估性能。所有资源可在https://github.com/e0397123/comp-analysis获取。

关键词

引用

@article{arxiv.2312.15407,
  title  = {A Comprehensive Analysis of the Effectiveness of Large Language Models as Automatic Dialogue Evaluators},
  author = {Chen Zhang and Luis Fernando D'Haro and Yiming Chen and Malu Zhang and Haizhou Li},
  journal= {arXiv preprint arXiv:2312.15407},
  year   = {2024}
}

备注

An extended version of AAAI-2024 camera-ready paper (appendix included, 16 pages)