超越用户自报告李克特量表评分:一种用于对话自动评估的比较模型
计算与语言
2020-09-23 v2 人工智能
机器学习
摘要
开放域对话系统评估是对话研究中最重要的挑战之一。现有的自动评估指标(如 BLEU)大多基于参考,它们计算生成回复与有限数量可用参考之间的差异。基于李克特评分的自报告用户评分被社交对话系统(如 Amazon Alexa Prize 聊天机器人)广泛采用。然而,自报告用户评分存在不同用户间的偏差与方差。为缓解此问题,我们将对话评估表述为一个比较任务。我们还提出了一种自动评估模型 CMADE(Comparison Model for Automatic Dialog Evaluation,对话自动评估比较模型),该模型在训练于自报告用户评分时能自动清洗这些评分。具体而言,我们首先使用自监督方法学习更好的对话特征表示,然后使用 KNN 和 Shapley 去除混淆样本。我们的实验表明,CMADE 在对话比较任务中达到了 89.2% 的准确率。
引用
@article{arxiv.2005.10716,
title = {Beyond User Self-Reported Likert Scale Ratings: A Comparison Model for Automatic Dialog Evaluation},
author = {Weixin Liang and James Zou and Zhou Yu},
journal= {arXiv preprint arXiv:2005.10716},
year = {2020}
}