无监督指标在任务型对话中评估自然语言生成的相关性
计算与语言
2017-06-30 v1
摘要
BLEU 等自动化指标在机器翻译文献中被广泛使用。最近,对话社区也将其用于评估对话响应生成。然而,此前在对话响应生成方面的工作表明,在非任务型对话设置中,这些指标与人类判断的相关性不强。任务型对话响应表达在较窄的领域内且多样性较低。因此有理由认为,在任务型设置中,这些自动化指标会与人类判断具有良好的相关性,因为该生成任务包括将对话行为翻译为句子。我们进行了一项实证研究以确认情况是否如此。我们的发现表明,与非任务型设置中观察到的情况相比,这些自动化指标在任务型设置中与人类判断具有更强的相关性。我们还观察到,对于提供多个基本事实参考句的数据集,这些指标的相关性甚至更好。此外,我们表明当前一些可用的任务型语言生成语料库可以通过简单模型解决,并倡导构建更具挑战性的数据集。
引用
@article{arxiv.1706.09799,
title = {Relevance of Unsupervised Metrics in Task-Oriented Dialogue for Evaluating Natural Language Generation},
author = {Shikhar Sharma and Layla El Asri and Hannes Schulz and Jeremie Zumer},
journal= {arXiv preprint arXiv:1706.09799},
year = {2017}
}