用于序列生成的嵌套Wasserstein自模仿学习
计算与语言
2020-01-22 v1 机器学习
摘要
强化学习(RL)已被广泛研究用于改进序列生成模型。然而,用于RL训练的传统奖励通常无法捕获充分的语义信息,从而导致模型偏差。此外,稀疏且延迟的奖励使RL探索效率低下。为缓解这些问题,我们提出嵌套Wasserstein距离的概念用于分布语义匹配。为进一步利用它,我们开发了一种新颖的嵌套Wasserstein自模仿学习框架,鼓励模型利用历史高奖励序列以增强探索并改善语义匹配。我们的方案可理解为以Wasserstein信赖域近似执行近端策略优化。在多种无条件与条件序列生成任务上的实验表明,所提方法一致地带来性能提升。
引用
@article{arxiv.2001.06944,
title = {Nested-Wasserstein Self-Imitation Learning for Sequence Generation},
author = {Ruiyi Zhang and Changyou Chen and Zhe Gan and Zheng Wen and Wenlin Wang and Lawrence Carin},
journal= {arXiv preprint arXiv:2001.06944},
year = {2020}
}
备注
Accepted by AISTATS2020