中文

模仿学习与强化学习在释义生成中的经验比较

计算与语言 2022-09-27 v1 机器学习

摘要

从给定句子生成释义涉及从大型词汇表中逐步解码单词。为训练解码器,最大化 token 似然的有监督学习总是受限于曝光偏差。尽管强化学习(RL)和模仿学习(IL)已被广泛用于缓解该偏差,但缺乏直接比较导致对其优势仅有片面认识。本工作中,我们以指针生成器为基础模型,对 RL 和 IL 如何助力提升释义生成性能进行了实证研究。在基准数据集上的实验表明:(1) 模仿学习持续优于强化学习;(2) 采用模仿学习的指针生成器模型以较大优势超越最先进(SOTA)方法。

关键词

引用

@article{arxiv.1908.10835,
  title  = {An Empirical Comparison on Imitation Learning and Reinforcement Learning for Paraphrase Generation},
  author = {Wanyu Du and Yangfeng Ji},
  journal= {arXiv preprint arXiv:1908.10835},
  year   = {2022}
}

备注

9 pages, 2 figures, EMNLP2019