中文

离线强化学习中行为克隆的可靠条件化

机器学习 2023-02-07 v2 人工智能

摘要

行为克隆通过监督学习模仿离线轨迹,为离线强化学习提供了一种直接的解决方案。最近的研究进展表明,通过以期望的未来回报为条件,BC 的性能可以与基于价值的方法相媲美,同时具有更高的简单性和训练稳定性。尽管前景广阔,但我们表明这些方法可能不可靠,因为当以高且分布外(ood)的回报为条件时,其性能可能会显著下降。这在实践中至关重要,因为我们通常期望策略通过以 ood 值为条件来表现得比离线数据集更好。我们表明,这种不可靠性源于训练数据的次优性和模型架构。我们提出了 ConserWeightive Behavioral Cloning (CWBC),这是一种简单有效的方法,通过两个关键组件来提高条件化 BC 的可靠性:轨迹加权和保守正则化。轨迹加权对高回报轨迹进行上采样加权,以缩小 BC 方法的训练-测试差距,而保守正则化器则鼓励策略在 ood 条件化下保持接近数据分布。我们在 RvS 和 Decision Transformers 的背景下研究了 CWBC,并表明 CWBC 在各种基准上显著提升了它们的性能。

关键词

引用

@article{arxiv.2210.05158,
  title  = {Reliable Conditioning of Behavioral Cloning for Offline Reinforcement Learning},
  author = {Tung Nguyen and Qinqing Zheng and Aditya Grover},
  journal= {arXiv preprint arXiv:2210.05158},
  year   = {2023}
}