中文

利用多参考对抗数据集与大规模预训练改进对话评估

计算与语言 2020-09-25 v1

摘要

基于模型的对话评估指标(如ADEM、RUBER以及较新的基于BERT的指标)日益受到关注。这些模型旨在对所有相关回复赋予高分,并对所有不相关回复赋予低分。理想情况下,此类模型应使用任意给定语境下的多个相关与不相关回复进行训练。然而,尚无此类公开数据,因此现有模型通常使用单个相关回复和从其他语境随机选取的多个回复(随机负例)训练。为更好地训练并稳健评估基于模型的指标,我们引入DailyDialog++数据集,包含(i)每个语境五个相关回复,以及(ii)每个语境五个对抗性构造的不相关回复。使用该数据集,我们首先表明,即便存在多个正确参考,基于n-gram的指标和基于嵌入的指标在区分相关回复与甚至随机负例方面表现不佳。虽然基于模型的指标在随机负例上优于基于n-gram和嵌入的指标,但其在对抗样本上评估时性能大幅下降。为检验大规模预训练是否有助益,我们提出一种称为DEB的新型基于BERT的评估指标,其在7.27亿条Reddit对话上预训练,再于我们的数据集上微调。DEB显著优于现有模型,展现出与人工判断更好的相关性及在随机负例上更好的性能(88.27%准确率)。然而,其在对抗回复上评估时性能再次大幅下降,从而突显即便大规模预训练的评估模型对我们的数据集中的对抗样本也不具备鲁棒性。数据集与代码均已公开。

关键词

引用

@article{arxiv.2009.11321,
  title  = {Improving Dialog Evaluation with a Multi-reference Adversarial Dataset and Large Scale Pretraining},
  author = {Ananya B. Sai and Akash Kumar Mohankumar and Siddhartha Arora and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2009.11321},
  year   = {2020}
}

备注

Accepted for publication in TACL