中文

摆脱Bellman完备性:基于模型的回报条件监督学习实现轨迹拼接

机器学习 2023-12-05 v2 人工智能

摘要

基于离屏动态规划(DP)的技术(如QQ-学习)在序贯决策问题中已被证明十分重要。然而,在函数逼近存在的情况下,由于所考虑的函数类缺乏Bellman完备性(基于DP方法成功的关键条件),这些技术常常发散。在本文中,我们展示了基于回报条件监督学习(RCSL)的离屏学习技术如何能够规避这些Bellman完备性挑战,并在继承自监督学习的显著更宽松的假设下收敛。我们证明,存在一个自然环境,其中若使用两层多层感知机作为函数逼近器,要满足Bellman完备性,层宽需随状态空间大小线性增长,而RCSL仅需常数层宽。这些发现为解释在近最优数据集环境中RCSL方法相对于基于DP方法的优越实证性能迈出一步。此外,为了从次优数据集中学习,我们提出了一个称为MBRCSL的简单框架,赋予RCSL方法以动态规划能力,将来自不同轨迹的片段拼接起来。MBRCSL利用学习的动力学模型和前向采样来完成轨迹拼接,同时避免了困扰所有动态规划算法的Bellman完备性需求。我们提出了理论分析与实验评估来支持这些主张,在多个模拟机器人问题上优于最先进的免模型与基于模型的离线RL算法。

关键词

引用

@article{arxiv.2310.19308,
  title  = {Free from Bellman Completeness: Trajectory Stitching via Model-based Return-conditioned Supervised Learning},
  author = {Zhaoyi Zhou and Chuning Zhu and Runlong Zhou and Qiwen Cui and Abhishek Gupta and Simon Shaolei Du},
  journal= {arXiv preprint arXiv:2310.19308},
  year   = {2023}
}