面向离线强化学习分布外泛化的扩散策略
机器学习
2025-06-09 v4 人工智能
神经与进化计算
机器人学
摘要
离线强化学习(RL)方法利用以往经验来学习优于用于数据收集的行为策略的策略。然而,由于训练期间缺乏在线交互,它们面临处理分布偏移的挑战。为此,我们提出一种名为扩散策略的状态重建(SRDP)的新方法,该方法在近期一类扩散策略中引入状态重建特征学习,以解决分布外(OOD)泛化问题。我们的方法促进可泛化状态表示的学习,以缓解由 OOD 状态引起的分布偏移。为说明 SRDP 的 OOD 泛化与更快收敛,我们设计了一个新颖的 2D 多模态上下文赌博机环境,并在 6 自由度真实世界 UR10 机器人以及仿真中实现,将其性能与先前算法比较。特别地,我们通过消融研究展示了所提状态重建的重要性。此外,我们在标准连续控制基准(D4RL)上评估我们的模型,即 8 自由度蚂蚁的导航以及 half-cheetah、hopper 和 walker2d 的前向运动,取得了最先进的结果。最后,我们证明在稀疏连续控制导航任务中,当离线 RL 数据集去除了状态空间的多个区域(包括包含目标的区域)时,我们的方法相比竞争基线可实现 167% 的提升。
引用
@article{arxiv.2307.04726,
title = {Diffusion Policies for Out-of-Distribution Generalization in Offline Reinforcement Learning},
author = {Suzan Ece Ada and Erhan Oztop and Emre Ugur},
journal= {arXiv preprint arXiv:2307.04726},
year = {2025}
}
备注
Published in IEEE RA-L with IROS presentation option (2024 IEEE/RSJ International Conference on Intelligent Robots and Systems), 8 pages, 7 figures