中文

通过响应选择评估对话生成系统

计算与语言 2020-04-30 v1

摘要

现有的用于开放域对话响应生成系统的自动评估指标与人工评估相关性较差。我们专注于通过响应选择来评估响应生成系统。为通过响应选择恰当评估系统,我们提出了利用精心挑选的假候选来构建响应选择测试集的方法。具体而言,我们提出构建测试集时过滤掉某些类型的假候选:(i) 与真实响应无关的候选,以及 (ii) 可作为恰当响应被接受的候选。通过实验,我们表明与使用广泛的自动评估指标(如 BLEU)相比,利用我们方法开发的测试集通过响应选择评估系统与人工评估相关性更强。

关键词

引用

@article{arxiv.2004.14302,
  title  = {Evaluating Dialogue Generation Systems via Response Selection},
  author = {Shiki Sato and Reina Akama and Hiroki Ouchi and Jun Suzuki and Kentaro Inui},
  journal= {arXiv preprint arXiv:2004.14302},
  year   = {2020}
}

备注

accepted by ACL 2020