基于 DialoGPT 的互动对话无监督评估
计算与语言
2020-06-25 v1 人工智能
人机交互
摘要
为开放域对话研究定义有意义且可解释的自动评估指标十分重要。标准语言生成指标已被证明对对话无效。本文引入 FED 指标(对话细粒度评估,fine-grained evaluation of dialog),一种使用 DialoGPT 且无需任何微调或监督的自动评估指标。同时引入 FED 数据集,该数据集通过以十八项细粒度对话质量标注一组人-系统与人人对话构建而成。FED 指标(1)不依赖真实响应,(2)不需要训练数据,(3)在轮次与整体对话两个层面衡量细粒度对话质量。FED 在两个层面均取得与人工判断从中等到较强的相关性。
引用
@article{arxiv.2006.12719,
title = {Unsupervised Evaluation of Interactive Dialog with DialoGPT},
author = {Shikib Mehri and Maxine Eskenazi},
journal= {arXiv preprint arXiv:2006.12719},
year = {2020}
}
备注
Published at to SIGdial 2020