中文

MDD-Eval:基于增强数据自训练的多领域对话评估

计算与语言 2022-01-19 v2

摘要

聊天机器人被设计用于在不同领域进行类人对话,例如通用闲聊、知识交流和基于人格的对话。为衡量此类对话智能体的质量,对话评估器也需跨领域进行评估。然而,大多数最先进(SOTA)的自动对话评估指标(ADM)并非为多领域评估而设计。我们致力于设计一个通用且鲁棒的框架 MDD-Eval 来解决该问题。具体而言,我们首先利用人工标注数据训练一个教师评估器,以获得在特定领域内区分优劣对话回复的评分能力,随后采用自训练策略,用教师标注的多领域数据训练一个新的评估器,帮助新评估器泛化到多个领域。MDD-Eval 在六个对话评估基准上进行了充分评估。实证结果表明,MDD-Eval 框架取得了强劲性能,在所有评估基准上的平均 Spearman 相关系数相较 SOTA ADM 绝对提升了 7%。

关键词

引用

@article{arxiv.2112.07194,
  title  = {MDD-Eval: Self-Training on Augmented Data for Multi-Domain Dialogue Evaluation},
  author = {Chen Zhang and Luis Fernando D'Haro and Thomas Friedrichs and Haizhou Li},
  journal= {arXiv preprint arXiv:2112.07194},
  year   = {2022}
}

备注

AAAI-2022 Preprint (corrected the missing citation issue.)