对话的人类评估仍是一个开放问题:比较评估对话智能体各类方法的敏感性
计算与语言
2022-01-14 v1 人工智能
摘要
改进对话 AI 的核心在于如何评估对话这一开放问题。自动指标的缺陷已广为人知(Liu et al., 2016, arXiv:1603.08023),人类评估仍被视为黄金标准。遗憾的是,如何进行人类评估同样是一个开放问题:不同的数据收集方法具有不同水平的人类一致性与统计敏感性,导致所需人类标注时长与人工成本各异。在本工作中,我们比较了五种不同的基于众包工作者的人类评估方法,发现针对不同模型类型比较时最优方法不同,并无全面的明显胜出者。尽管这凸显了该领域的开放问题,我们的分析给出了何时使用何种方法的建议,以及可能的未来方向。
引用
@article{arxiv.2201.04723,
title = {Human Evaluation of Conversations is an Open Problem: comparing the sensitivity of various methods for evaluating dialogue agents},
author = {Eric Michael Smith and Orion Hsu and Rebecca Qian and Stephen Roller and Y-Lan Boureau and Jason Weston},
journal= {arXiv preprint arXiv:2201.04723},
year = {2022}
}