用于神经对话回复生成的负向训练
计算与语言
2020-08-19 v5 机器学习
摘要
尽管深度学习模型为开放域对话回复生成领域带来了巨大进步,近期研究结果揭示出训练后的模型具有不良的生成行为,例如恶意回复和通用(无聊)回复。在这项工作中,我们提出一个名为“负向训练”的框架来最小化此类行为。给定一个训练好的模型,该框架首先找出表现出不良行为的生成样本,然后用它们来提供负向训练信号以微调模型。我们的实验表明,负向训练能显著降低恶意回复的命中率,或抑制频繁回复并改善回复多样性。
引用
@article{arxiv.1903.02134,
title = {Negative Training for Neural Dialogue Response Generation},
author = {Tianxing He and James Glass},
journal= {arXiv preprint arXiv:1903.02134},
year = {2020}
}