模仿学习与强化学习在释义生成中的经验比较
计算与语言
2022-09-27 v1 机器学习
摘要
从给定句子生成释义涉及从大型词汇表中逐步解码单词。为训练解码器,最大化 token 似然的有监督学习总是受限于曝光偏差。尽管强化学习(RL)和模仿学习(IL)已被广泛用于缓解该偏差,但缺乏直接比较导致对其优势仅有片面认识。本工作中,我们以指针生成器为基础模型,对 RL 和 IL 如何助力提升释义生成性能进行了实证研究。在基准数据集上的实验表明:(1) 模仿学习持续优于强化学习;(2) 采用模仿学习的指针生成器模型以较大优势超越最先进(SOTA)方法。
引用
@article{arxiv.1908.10835,
title = {An Empirical Comparison on Imitation Learning and Reinforcement Learning for Paraphrase Generation},
author = {Wanyu Du and Yangfeng Ji},
journal= {arXiv preprint arXiv:1908.10835},
year = {2022}
}
备注
9 pages, 2 figures, EMNLP2019