基于 Softmax 策略梯度的冷启动强化学习
机器学习
2017-10-17 v2
摘要
强化学习的策略梯度方法有两个常见且不受欢迎的额外开销过程,即热启动训练和样本方差缩减。在本文中,我们描述了一种基于 softmax 值函数的强化学习方法,该方法不需要上述任何过程。我们的方法结合了策略梯度方法的优势与最大似然方法的效率和简单性。我们将这种新的冷启动强化学习方法应用于结构化输出预测问题的训练序列生成模型中。经验证据在自动摘要和图像描述任务上验证了该方法的有效性。
关键词
引用
@article{arxiv.1709.09346,
title = {Cold-Start Reinforcement Learning with Softmax Policy Gradient},
author = {Nan Ding and Radu Soricut},
journal= {arXiv preprint arXiv:1709.09346},
year = {2017}
}
备注
Conference on Neural Information Processing Systems 2017. Main paper and supplementary material