中文

具线性表示的近最优离线强化学习:利用方差信息进行悲观估计

机器学习 2022-03-14 v1 人工智能 机器学习

摘要

离线强化学习旨在利用离线/历史数据优化序贯决策策略,近期研究对其关注骤增。由于恰当的函数逼近器有助于缓解现代强化学习问题中的样本复杂度负担,现有工作通常采用强大的函数表示模型(如神经网络)来学习最优策略。然而,即便此类表示为线性,对带函数表示的统计极限的精确理解仍不明晰。为此,我们研究具线性模型表示的离线强化学习的统计极限。为导出紧致的离线学习界,我们设计了方差感知悲观值迭代(VAPVI),其对时变 episodic 线性马尔可夫决策过程(MDPs)采用值函数的条件方差信息。VAPVI 利用估计的值函数方差对最小二乘悲观值迭代中的贝尔曼残差重新加权,并较已知最优现有结果(其按设计对贝尔曼残差等权)给出了改进的离线学习界。更重要的是,我们的学习界以系统量表述,提供了以往结果所缺乏的自然的实例依赖刻画。我们希望我们的结果能更清晰地刻画当提供线性表示时离线学习应有的面貌。

关键词

引用

@article{arxiv.2203.05804,
  title  = {Near-optimal Offline Reinforcement Learning with Linear Representation: Leveraging Variance Information with Pessimism},
  author = {Ming Yin and Yaqi Duan and Mengdi Wang and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2203.05804},
  year   = {2022}
}

备注

ICLR 2022