中文

BiTrajDiff:基于扩散模型的双向轨迹生成用于离线强化学习

机器学习 2026-05-15 v5

摘要

近期的离线强化学习(RL)进展表明,对预收集数据集施加保守约束有助于有效的策略学习。然而,这些静态数据集常常存在分布偏差,导致可迁移性有限。为此,简单解决方案是数据增强(DA),它利用生成模型丰富数据分布。尽管已取得鼎舞效果,但当前的DA技术仅关注从给定状态重建未来轨迹,忽略了到达这些轨迹的历史过渡探索。这种单向范式不可避免地阻碍了发现多样行为模式,尤其是可能导致高回报结果的关键状态。本文引入双向轨迹扩散(BiTrajDiff),这是一种用于离线RL的新型DA框架,通过建模来自任意中间状态的未来轨迹和历史轨迹。具体而言,我们将轨迹生成任务分解为两个独立却互补的扩散过程:一个生成前向轨迹以预测未来动力学,另一个生成后向轨迹以追溯关键历史过渡。BiTrajDiff能够高效地将关键状态作为锚点,向可能在探索不足的区域扩展,从而促进数据集的多样性。在D4RL基准套件上的大量实验表明,BiTrajDiff在各种离线RL骨架上均优于其他先进DA方法。

关键词

引用

@article{arxiv.2506.05762,
  title  = {BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning},
  author = {Yunpeng Qing and Yixiao Chi and Shuo Chen and Shunyu Liu and Kexuan Zhou and Sixu Lin and Litao Liu and Changqing Zou},
  journal= {arXiv preprint arXiv:2506.05762},
  year   = {2026}
}