中文

GRADE:用于评估开放域对话系统的自动图增强连贯性度量

计算与语言 2020-10-09 v1

摘要

自动评估对话连贯性是开发高质量开放域对话系统的一项具有挑战性但需求极高的能力。然而,当前的评估指标仅考虑表面特征或话语级语义,而未明确考虑对话流中细粒度的主题转移动态。在此,我们首先认为,由对话中的主题构成的图结构可以准确描绘潜在的交流逻辑,这是一种产生有说服力度量的更自然的方式。基于主题级对话图,我们提出了一种新的评估指标 GRADE,代表用于自动对话评估的图增强表示。具体而言,GRADE 结合了粗粒度的话语级上下文表示和细粒度的主题级图表示来评估对话连贯性。图表示是通过对用常识图证据增强的主题级对话图进行推理获得的,包括 k 跳邻域表示和跳注意力权重。实验结果表明,在与人类判断的 Pearson 和 Spearman 相关性方面,我们的 GRADE 在衡量不同对话模型时显著优于其他最先进的指标。此外,我们发布了一个全新的大规模人工评估基准,以促进未来关于自动指标的研究。

关键词

引用

@article{arxiv.2010.03994,
  title  = {GRADE: Automatic Graph-Enhanced Coherence Metric for Evaluating Open-Domain Dialogue Systems},
  author = {Lishan Huang and Zheng Ye and Jinghui Qin and Liang Lin and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2010.03994},
  year   = {2020}
}

备注

Long paper; EMNLP2020