中文

从扰动中学习:基于逆对抗训练的多样且信息丰富的对话生成

计算与语言 2021-06-01 v1

摘要

在本文中,我们提出逆对抗训练(Inverse Adversarial Training, IAT)算法,用于训练神经对话系统以避免通用回复并更好地建模对话历史。与标准对抗训练算法不同,IAT 鼓励模型对对话历史中的扰动保持敏感,从而从扰动中学习。通过对在对话历史被扰动时输出概率下降更显著的回复给予更高奖励,模型被鼓励生成更多样且一致的回复。通过对在给定扰动对话历史时生成相同回复的模型进行惩罚,模型被迫更好地捕捉对话历史并生成更具信息量的回复。在两个基准数据集上的实验结果表明,我们的方法能更好地建模对话历史并生成更多样且一致的回复。此外,我们指出了广泛使用的基于最大互信息(MMI)的用于提升对话回复生成模型多样性方法的一个问题,并进行了实证演示。

关键词

引用

@article{arxiv.2105.15171,
  title  = {Learning from Perturbations: Diverse and Informative Dialogue Generation with Inverse Adversarial Training},
  author = {Wangchunshu Zhou and Qifei Li and Chenle Li},
  journal= {arXiv preprint arXiv:2105.15171},
  year   = {2021}
}

备注

ACL 2021