中文

离线强化学习中的离散扩散技能

机器学习 2025-03-27 v1 人工智能 机器人学

摘要

技能已被引入离线强化学习 (RL) 作为处理复杂、长期任务的时序抽象,以促进一致的行为并实现有意义的探索。尽管离线 RL 中的技能主要建模于连续潜在空间,但离散技能空间的潜力仍 largely 未被探索。本文提出一种用于离线 RL 任务的紧凑离散技能空间,由基于最新 Transformer 编码器和扩散解码器支持。结合通过离线 RL 技术训练的高层策略,我们的方法建立了一个分层 RL 框架,其中训练好的扩散解码器发挥关键作用。经验评估表明,所提出的算法,即离散扩散技能 (Discrete Diffusion Skill, DDS),是一种强大的离线 RL 方法。DDS 在 Locomotion 和 Kitchen 任务上表现出竞争力,在长期任务上表现突出,在 AntMaze-v2 基准测试中相较于现有离线 RL 方法实现至少 12% 的改进。此外,DDS 在可解释性、训练稳定性和在线探索方面均优于以往基于技能的方法。

关键词

引用

@article{arxiv.2503.20176,
  title  = {Offline Reinforcement Learning with Discrete Diffusion Skills},
  author = {RuiXi Qiao and Jie Cheng and Xingyuan Dai and Yonglin Tian and Yisheng Lv},
  journal= {arXiv preprint arXiv:2503.20176},
  year   = {2025}
}