中文

可证明的基于模型的非线性 Bandit 与强化学习:搁置乐观,拥抱虚拟曲率

机器学习 2022-08-04 v5

摘要

本文研究具有非线性函数近似的基于模型的 bandit 与强化学习(RL)。我们提出研究向近似局部极大值的收敛,因为我们证明即使对具有确定性奖励的单层神经网络 bandit,全局收敛在统计上也是难以处理的。对非线性 bandit 与 RL,本文给出一种基于模型的算法——带在线模型学习器的虚拟上升(ViOlin),其可证明以仅依赖于模型类的序列 Rademacher 复杂度的样本复杂度收敛到局部极大值。我们的结果意味着对若干具体设定(如具有有限或稀疏模型类的线性 bandit、以及两层神经网络 bandit)的新颖全局或局部后悔界。一个关键的算法见解是:乐观甚至对两层神经网络模型类也可能导致过度探索。另一方面,对收敛到局部极大值,若模型也能合理预测真实回报的梯度与 Hessian 的大小,则最大化虚拟回报已足够。

关键词

引用

@article{arxiv.2102.04168,
  title  = {Provable Model-based Nonlinear Bandit and Reinforcement Learning: Shelve Optimism, Embrace Virtual Curvature},
  author = {Kefan Dong and Jiaqi Yang and Tengyu Ma},
  journal= {arXiv preprint arXiv:2102.04168},
  year   = {2022}
}

备注

Updated Figure 1 and its caption