MDD-Eval:基于增强数据自训练的多领域对话评估
计算与语言
2022-01-19 v2
摘要
聊天机器人被设计用于在不同领域进行类人对话,例如通用闲聊、知识交流和基于人格的对话。为衡量此类对话智能体的质量,对话评估器也需跨领域进行评估。然而,大多数最先进(SOTA)的自动对话评估指标(ADM)并非为多领域评估而设计。我们致力于设计一个通用且鲁棒的框架 MDD-Eval 来解决该问题。具体而言,我们首先利用人工标注数据训练一个教师评估器,以获得在特定领域内区分优劣对话回复的评分能力,随后采用自训练策略,用教师标注的多领域数据训练一个新的评估器,帮助新评估器泛化到多个领域。MDD-Eval 在六个对话评估基准上进行了充分评估。实证结果表明,MDD-Eval 框架取得了强劲性能,在所有评估基准上的平均 Spearman 相关系数相较 SOTA ADM 绝对提升了 7%。
引用
@article{arxiv.2112.07194,
title = {MDD-Eval: Self-Training on Augmented Data for Multi-Domain Dialogue Evaluation},
author = {Chen Zhang and Luis Fernando D'Haro and Thomas Friedrichs and Haizhou Li},
journal= {arXiv preprint arXiv:2112.07194},
year = {2022}
}
备注
AAAI-2022 Preprint (corrected the missing citation issue.)