中文

非线性策略下可证明正确的优化与探索

机器学习 2021-03-23 v1 机器学习

摘要

策略优化方法仍是经验强化学习(RL)中的有力主力,其聚焦于可轻松推理复杂且连续状态与/或动作空间的神经策略。然而,对于带非线性函数近似的基于策略方法中的策略性探索,理论理解大体缺失。本文通过设计 ENIAC(一种允许评论家使用非线性函数近似的 actor-critic 方法)来解决此问题。我们证明在某些假设下(如评论家类的 eluder 维数 dd 有界),学习者在 O(\poly(d))O(\poly(d)) 轮探索内找到近最优策略。该方法对模型误设具有鲁棒性,并严格扩展了现有关于线性函数近似的工作。我们还开发了该方法的一些计算优化(统计保证略弱)以及基于现有深度 RL 工具的实证适配。我们实证评估了该适配,显示其优于受线性方法启发的先前启发式方法,通过正确推理智能体在非线性函数近似下的不确定性确立了价值。

关键词

引用

@article{arxiv.2103.11559,
  title  = {Provably Correct Optimization and Exploration with Non-linear Policies},
  author = {Fei Feng and Wotao Yin and Alekh Agarwal and Lin F. Yang},
  journal= {arXiv preprint arXiv:2103.11559},
  year   = {2021}
}