中文

PONE:一种用于开放域生成式对话系统的新型自动评价指标

计算与语言 2020-04-07 v1

摘要

开放域生成式对话系统在过去几年中引起了相当多的关注。目前,如何自动评价它们仍是一个巨大的挑战性问题。据我们所知,评价开放域生成式对话系统有三类自动方法:(1)基于词重叠的指标;(2)基于嵌入的指标;(3)基于学习的指标。由于缺乏系统性比较,尚不清楚哪类指标更有效。在本文中,我们将首先在同一实验设置下系统性地度量各类自动评价指标,以检验哪类最佳。通过大量实验,基于学习的指标被证明是开放域生成式对话系统最有效的评价指标。此外,我们观察到几乎所有基于学习的指标都依赖于负采样机制,该机制获得一个极度不平衡且低质量的数据集来训练打分模型。为解决此问题,我们提出了一种新颖可行的基于学习的指标,通过使用增广的正样本和有价值的负样本,可显著提升与人类判断的相关性,称为 PONE。大量实验表明,我们提出的评价方法显著优于最先进(SOTA)的基于学习的评价方法,平均相关性提升 13.18%。此外,我们已公开发布我们所提方法以及最先进基线的代码。

关键词

引用

@article{arxiv.2004.02399,
  title  = {PONE: A Novel Automatic Evaluation Metric for Open-Domain Generative Dialogue Systems},
  author = {Tian Lan and Xian-Ling Mao and Wei Wei and Xiaoyan Gao and Heyan Huang},
  journal= {arXiv preprint arXiv:2004.02399},
  year   = {2020}
}