中文

具有可微函数近似的离线强化学习是可证明高效的

机器学习 2022-11-28 v2 人工智能 机器学习

摘要

离线强化学习旨在利用历史数据优化序列决策策略,已广泛应用于实际场景。最先进的算法通常借助强大的函数近似器(如神经网络)来缓解样本复杂性障碍,从而获得更好的经验性能。尽管取得了成功,对函数近似的统计复杂性的更系统性理解仍然缺乏。为弥补这一差距,我们迈出一步,考虑使用可微函数类近似(DFA)的离线强化学习。该函数类自然涵盖了具有非线性/非凸结构的广泛模型。最重要的是,我们通过分析悲观拟合 Q 学习(PFQL)算法,证明了具有可微函数近似的离线 RL 是可证明高效的,且我们的结果为理解依赖拟合 Q 迭代风格设计的多种实用启发式方法提供了理论基础。此外,我们通过更紧的实例相关刻画进一步改进了我们的保证。我们希望我们的工作能引起对超出当前研究范围、研究具有可微函数近似的强化学习的兴趣。

关键词

引用

@article{arxiv.2210.00750,
  title  = {Offline Reinforcement Learning with Differentiable Function Approximation is Provably Efficient},
  author = {Ming Yin and Mengdi Wang and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2210.00750},
  year   = {2022}
}