用于二元向量动作的 Q 网络
神经与进化计算
2015-12-07 v1 机器学习
摘要
本文研究了具有二元向量动作的强化学习。我们提出了一种用于近似带二元向量动作的动作值函数的神经网络有效架构。所提架构关于动作向量以线性函数近似动作值函数,但关于状态输入仍是非线性的。我们表明该近似方法能够高效计算贪婪动作选择和softmax动作选择。利用该架构,我们提出了一种基于Q-learning的在线算法。在网格世界和blocker任务中的经验结果表明,我们的近似架构对于具有大型离散动作集的强化学习(RL)问题有效。
引用
@article{arxiv.1512.01332,
title = {Q-Networks for Binary Vector Actions},
author = {Naoto Yoshida},
journal= {arXiv preprint arXiv:1512.01332},
year = {2015}
}
备注
9 pages, 5 figures, accepted for Deep Reinforcement Learning Workshop, NIPS 2015