中文

论强化学习中的模型误设定

机器学习 2024-01-09 v2

摘要

强化学习(RL)的成功在处理复杂真实模型时关键依赖于有效的函数逼近。现有样本高效 RL 算法主要采用三种函数逼近方法:基于策略、基于价值和基于模型的方法。然而,面对模型误设定(真实模型与最优函数逼近器之间的差异),研究表明基于策略的方法即使策略函数逼近存在较大的局部有界误设定误差(函数类在特定状态和动作上可能呈现 Ω(1)\Omega(1) 逼近误差,但在策略诱导的状态分布上平均误差仍较小)也可保持鲁棒。但类似鲁棒性是否能在基于价值和基于模型的方法中实现,尤其在使用一般函数逼近时,仍属开放问题。为弥补此差距,本文提出一个统一理论框架以处理 RL 中的模型误设定。我们证明,通过精细的算法设计和复杂分析,采用一般函数逼近的基于价值和基于模型的方法可在局部误设定误差界下实现鲁棒性。特别地,它们可达到 O~(poly(dH)(K+Kζ))\widetilde{O}\left(\text{poly}(d H)(\sqrt{K} + K\zeta) \right) 的遗憾界,其中 dd 表示函数类的复杂度,HH 为回合长度,KK 为总回合数,ζ\zeta 表示误设定误差的局部界。此外,我们提出了一种无需先验知道 ζ\zeta 即可达到同阶遗憾界的算法框架,从而增强其实用性。

关键词

引用

@article{arxiv.2306.10694,
  title  = {On the Model-Misspecification in Reinforcement Learning},
  author = {Yunfan Li and Lin Yang},
  journal= {arXiv preprint arXiv:2306.10694},
  year   = {2024}
}