对话评估指标的综合评测
计算与语言
2021-07-09 v4 人工智能
摘要
自动评估指标是对话系统研究的关键组成部分。已知标准语言评估指标对对话的评估效果不佳。因此,近期的研究提出了许多与人工判断相关性更好的新型对话专用指标。由于研究进展迅速,这些指标许多已在不同的数据集上进行了评估,迄今尚无时间对它们进行系统比较。为此,本文在多个数据集上对已提出的对话评估指标进行了综合评测。本文在 10 个不同数据集上评估了 23 种不同的自动评估指标。此外,还在不同设置下对指标进行了评估,以更好地界定它们各自的优缺点。指标在以下方面被评估:(1)在轮次级别和对话级别上,(2)针对不同对话长度,(3)针对不同对话质量(如连贯性、吸引力),(4)针对不同响应生成模型类型(即生成式、检索式、简单模型和最优模型),(5)考虑不同指标的相似性,以及(6)探索不同指标的组合。该综合评测就对话评估指标给出了若干总体启示,也提出了评估指标的最佳方式并指出了未来工作的有前景方向。
引用
@article{arxiv.2106.03706,
title = {A Comprehensive Assessment of Dialog Evaluation Metrics},
author = {Yi-Ting Yeh and Maxine Eskenazi and Shikib Mehri},
journal= {arXiv preprint arXiv:2106.03706},
year = {2021}
}