面向交互式语言学习的监督种子迭代学习
计算与语言
2020-10-08 v1
摘要
语言漂移一直是经由交互训练语言模型的主要障碍之一。当基于词的对话智能体被训练以完成某项任务时,它们倾向于发明自己的语言而非利用自然语言。在近期文献中,两种通用方法部分地遏制了该现象:监督自博弈(S2P)与种子迭代学习(SIL)。S2P 联合训练交互式损失与监督损失以对抗漂移,而 SIL 改变训练动态以防止语言漂移发生。在本文中,我们首先指出它们各自的弱点,即在人类语料库上评估时的后期训练崩溃与较高的负对数似然。基于这些观察,我们引入监督种子迭代学习以结合两种方法,从而最小化它们各自的弱点。随后我们在语言漂移翻译游戏中展示了该算法(\algo)的有效性。
引用
@article{arxiv.2010.02975,
title = {Supervised Seeded Iterated Learning for Interactive Language Learning},
author = {Yuchen Lu and Soumye Singhal and Florian Strub and Olivier Pietquin and Aaron Courville},
journal= {arXiv preprint arXiv:2010.02975},
year = {2020}
}