近端策略优化及其动态版本用于序列生成
计算与语言
2018-08-27 v1 机器学习
机器学习
摘要
在序列生成任务中,许多工作使用策略梯度进行模型优化,以应对在最大化不可微评价指标或在对抗学习中欺骗判别器时难以处理的反向传播问题。在本文中,我们用已被证明更高效的强化学习算法近端策略优化(PPO)替代策略梯度,并提出一种 PPO 的动态方法(PPO-dynamic)。我们在包括合成实验与闲聊聊天机器人的条件序列生成任务上展示了 PPO 与 PPO-dynamic 的有效性。结果表明 PPO 与 PPO-dynamic 在稳定性与性能上均优于策略梯度。
引用
@article{arxiv.1808.07982,
title = {Proximal Policy Optimization and its Dynamic Version for Sequence Generation},
author = {Yi-Lin Tuan and Jinzhi Zhang and Yujia Li and Hung-yi Lee},
journal= {arXiv preprint arXiv:1808.07982},
year = {2018}
}