中文

基于 DialoGPT 的互动对话无监督评估

计算与语言 2020-06-25 v1 人工智能 人机交互

摘要

为开放域对话研究定义有意义且可解释的自动评估指标十分重要。标准语言生成指标已被证明对对话无效。本文引入 FED 指标(对话细粒度评估,fine-grained evaluation of dialog),一种使用 DialoGPT 且无需任何微调或监督的自动评估指标。同时引入 FED 数据集,该数据集通过以十八项细粒度对话质量标注一组人-系统与人人对话构建而成。FED 指标(1)不依赖真实响应,(2)不需要训练数据,(3)在轮次与整体对话两个层面衡量细粒度对话质量。FED 在两个层面均取得与人工判断从中等到较强的相关性。

关键词

引用

@article{arxiv.2006.12719,
  title  = {Unsupervised Evaluation of Interactive Dialog with DialoGPT},
  author = {Shikib Mehri and Maxine Eskenazi},
  journal= {arXiv preprint arXiv:2006.12719},
  year   = {2020}
}

备注

Published at to SIGdial 2020