中文

如何不评估你的对话系统:对话响应生成无监督评估指标的实证研究

计算与语言 2017-01-04 v2 人工智能 机器学习 神经与进化计算

摘要

我们研究了在无监督标签(如任务完成)不可用的情形下,对话响应生成系统的评估指标。近期响应生成工作采用了机器翻译的指标,将模型生成的响应与单一目标响应进行比较。我们展示出,这些指标在非技术 Twitter 领域与人类判断相关性极弱,而在技术 Ubuntu 领域则完全不相关。我们提供了定量与定性结果,突出已有指标的具体弱点,并为未来开发更好的对话系统自动评估指标提供建议。

关键词

引用

@article{arxiv.1603.08023,
  title  = {How NOT To Evaluate Your Dialogue System: An Empirical Study of Unsupervised Evaluation Metrics for Dialogue Response Generation},
  author = {Chia-Wei Liu and Ryan Lowe and Iulian V. Serban and Michael Noseworthy and Laurent Charlin and Joelle Pineau},
  journal= {arXiv preprint arXiv:1603.08023},
  year   = {2017}
}

备注

First 4 authors had equal contribution. 13 pages, 5 tables, 6 figures. EMNLP 2016