如何不评估你的对话系统:对话响应生成无监督评估指标的实证研究
计算与语言
2017-01-04 v2 人工智能
机器学习
神经与进化计算
摘要
我们研究了在无监督标签(如任务完成)不可用的情形下,对话响应生成系统的评估指标。近期响应生成工作采用了机器翻译的指标,将模型生成的响应与单一目标响应进行比较。我们展示出,这些指标在非技术 Twitter 领域与人类判断相关性极弱,而在技术 Ubuntu 领域则完全不相关。我们提供了定量与定性结果,突出已有指标的具体弱点,并为未来开发更好的对话系统自动评估指标提供建议。
引用
@article{arxiv.1603.08023,
title = {How NOT To Evaluate Your Dialogue System: An Empirical Study of Unsupervised Evaluation Metrics for Dialogue Response Generation},
author = {Chia-Wei Liu and Ryan Lowe and Iulian V. Serban and Michael Noseworthy and Laurent Charlin and Joelle Pineau},
journal= {arXiv preprint arXiv:1603.08023},
year = {2017}
}
备注
First 4 authors had equal contribution. 13 pages, 5 tables, 6 figures. EMNLP 2016