中文

PairEval:基于成对比较的开放域对话评估

计算与语言 2024-07-19 v2

摘要

为开放域对话系统构建可靠且自动化的评估指标是一个必要但具有挑战性的问题。最近的研究提出了通过考虑生成的响应与先前对话历史的相关性来评估它们的指标。尽管有效,但这些指标直接评估单个响应,而不是考虑它们与其他响应相比的相对质量。为了解决这个问题,我们提出了PairEval,一种新颖的对话评估指标,通过将响应的质量与不同对话中的响应进行比较来评估响应。PairEval建立在开源的中型语言模型之上,我们使它们专门用于对话响应之间的成对比较。在多个基准上的大量实验表明,我们的指标与人类判断的相关性高于基线指标。我们还发现,所提出的比较指标在检测开放域对话系统的常见失败(包括重复和说话人敏感性缺失)方面更加鲁棒。

关键词

引用

@article{arxiv.2404.01015,
  title  = {PairEval: Open-domain Dialogue Evaluation with Pairwise Comparison},
  author = {ChaeHun Park and Minseok Choi and Dohyun Lee and Jaegul Choo},
  journal= {arXiv preprint arXiv:2404.01015},
  year   = {2024}
}

备注

COLM2024 (accepted)