面向基于策略梯度的文本生成的迁移奖励学习
机器学习
2019-09-10 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
任务特定分数常用于优化并评估条件文本生成系统的性能。然而,此类分数不可微,无法用于标准监督学习范式。因此,策略梯度方法被采用,因其可在无需可微目标的情况下计算梯度。然而,我们认为当前用作奖励的基于n-gram重叠的度量可通过使用从直接比较句子对相似度的任务中迁移的基于模型的奖励来改进。这些奖励模型要么输出整个预测句与目标句之间句子级句法和语义相似度分数作为期望回报,要么输出中间短语作为分段累积奖励。我们证明,在图像描述任务的策略梯度模型中,使用可迁移奖励学习器(Transferable Reward Learner)可在语义评估度量上取得改善。我们的InferSent actor-critic模型在MSCOCO上以词移距离(Word Mover's Distance)相似度度量评估时比BLEU训练出的actor-critic模型高出6.97分,在滑窗余弦相似度(Sliding Window Cosine Similarity)度量上也高出10.48分。在较小的Flickr-30k数据集上亦获得类似性能提升,证明了所提迁移学习方法的普遍适用性。
引用
@article{arxiv.1909.03622,
title = {Transfer Reward Learning for Policy Gradient-Based Text Generation},
author = {James O' Neill and Danushka Bollegala},
journal= {arXiv preprint arXiv:1909.03622},
year = {2019}
}