通过从演示中学习进行文本生成
计算与语言
2021-03-04 v2 机器学习
摘要
当前文本生成的方法主要依赖自回归模型和最大似然估计。这一范式导致(i)由于学习目标与评估指标不匹配(似然 vs. 质量)而产生多样但低质量的样本,以及(ii)由于历史分布不匹配(金标准 vs. 模型生成)而产生暴露偏差。为缓解这些问题,我们将文本生成构建为一个带有专家演示(即参考)的离线强化学习(RL)问题,其目标是在给定模型生成历史的情况下最大化质量。我们提出了 GOLD(通过从演示中离策略学习进行生成):一种易于优化的算法,通过重要性加权从演示中学习。直观上,GOLD 在训练期间对参考中置信度高的词元上加权、对置信度低的词元下加权,避免了先前依赖在线数据收集的 RL 方法所面临的优化问题。根据自动和人工评估,由 GOLD 训练的模型在摘要、问题生成和机器翻译上优于由 MLE 和策略梯度训练的模型。此外,我们的模型对解码算法较不敏感,并缓解了暴露偏差。
引用
@article{arxiv.2009.07839,
title = {Text Generation by Learning from Demonstrations},
author = {Richard Yuanzhe Pang and He He},
journal= {arXiv preprint arXiv:2009.07839},
year = {2021}
}
备注
ICLR 2021