中文

窥探表象之下:利用基本对称性实现样本高效的离线强化学习

机器学习 2023-11-14 v6 人工智能

摘要

离线强化学习(RL)通过从预先收集的数据集中学习策略而无需与环境交互,为现实世界任务提供了一种有吸引力的方法。然而,现有离线 RL 算法的性能严重依赖于数据集的规模与状态-动作空间覆盖率。现实世界的数据收集往往代价高昂且不可控,导致数据集小而覆盖狭窄,给离线 RL 的实际部署带来重大挑战。在本文中,我们提出一个新见解:利用系统动力学的基本对称性可以在小数据集下显著提升离线 RL 性能。具体而言,我们提出一种时间反演对称性(T-对称性)强制的动力学模型(TDM),其在成对的正向与反向潜在动力学之间建立一致性。TDM 既为小数据集提供了良好的表示,又基于是否符合 T-对称性为分布外(OOD)样本提供了一种新的可靠性度量。这些可直接用于构建一种新的离线 RL 算法(TSRL),其具有较不保守的策略约束和可靠的潜在空间数据增强过程。基于大量实验,我们发现 TSRL 在仅有原始样本 1% 的小基准数据集上取得了优异性能,在数据效率与泛化性方面显著优于近期离线 RL 算法。代码见:https://github.com/pcheng2/TSRL

关键词

引用

@article{arxiv.2306.04220,
  title  = {Look Beneath the Surface: Exploiting Fundamental Symmetry for Sample-Efficient Offline RL},
  author = {Peng Cheng and Xianyuan Zhan and Zhihao Wu and Wenjia Zhang and Shoucheng Song and Han Wang and Youfang Lin and Li Jiang},
  journal= {arXiv preprint arXiv:2306.04220},
  year   = {2023}
}

备注

Accepted in NeurIPS 2023; The first two authors contributed equally