中文

增加输入维度能否改进深度强化学习?

机器学习 2020-06-30 v2 机器人学 机器学习

摘要

深度强化学习(RL)算法近期在各种序贯决策任务中取得显著成功,得益于训练大型深度网络方法的进展。然而,这些方法通常需要大量训练数据,这往往是实际应用中的一大问题。一个自然的问题是:为状态学习良好表征并使用更大网络是否有助于学习更好的策略。本文尝试研究增加输入维度是否有助于提升无模型深度 RL 算法的性能与样本效率。为此,我们提出一种在线特征提取器网络(OFENet),利用神经网络产生良好表征作为深度 RL 算法的输入。尽管高输入维度通常被认为会使 RL 智能体学习更困难,我们表明 RL 智能体实际上用高维表征比用低维状态观测学习更高效。我们认为更强的特征传播连同更大的网络(从而更大的搜索空间)使 RL 智能体能够学习更复杂的状态函数,从而提升样本效率。通过数值实验,我们表明所提方法在样本效率与性能上均优于若干其他 SOTA 算法。所提方法的代码见 http://www.merl.com/research/license/OFENet 。

关键词

引用

@article{arxiv.2003.01629,
  title  = {Can Increasing Input Dimensionality Improve Deep Reinforcement Learning?},
  author = {Kei Ota and Tomoaki Oiki and Devesh K. Jha and Toshisada Mariyama and Daniel Nikovski},
  journal= {arXiv preprint arXiv:2003.01629},
  year   = {2020}
}

备注

11 pages, 10 figures. Accepted to ICML 2020