非线性策略下可证明正确的优化与探索
机器学习
2021-03-23 v1 机器学习
摘要
策略优化方法仍是经验强化学习(RL)中的有力主力,其聚焦于可轻松推理复杂且连续状态与/或动作空间的神经策略。然而,对于带非线性函数近似的基于策略方法中的策略性探索,理论理解大体缺失。本文通过设计 ENIAC(一种允许评论家使用非线性函数近似的 actor-critic 方法)来解决此问题。我们证明在某些假设下(如评论家类的 eluder 维数 有界),学习者在 轮探索内找到近最优策略。该方法对模型误设具有鲁棒性,并严格扩展了现有关于线性函数近似的工作。我们还开发了该方法的一些计算优化(统计保证略弱)以及基于现有深度 RL 工具的实证适配。我们实证评估了该适配,显示其优于受线性方法启发的先前启发式方法,通过正确推理智能体在非线性函数近似下的不确定性确立了价值。
引用
@article{arxiv.2103.11559,
title = {Provably Correct Optimization and Exploration with Non-linear Policies},
author = {Fei Feng and Wotao Yin and Alekh Agarwal and Lin F. Yang},
journal= {arXiv preprint arXiv:2103.11559},
year = {2021}
}