ASTRO:基于动态引导的轨迹拼接适应方法
机器学习
2025-12-17 v2 人工智能
摘要
离线强化学习(offline reinforcement learning, RL)使智能体能够从预收集的数据集中学习最优策略。然而,包含次优和碎片化轨迹的数据集为奖励传播带来了挑战,导致价值估计不准确并降低策略性能。虽然基于生成模型的轨迹拼接提供了可行的解决方案,但现有数据增强方法常常产生要么受行为策略支持限制的轨迹,要么违反底层动力学的轨迹,从而限制其对策略改进的有效性。我们提出了 ASTRO 框架,用于离线 RL 生成分布式新颖且符合动力学的轨迹。ASTRO 首先学习时间距离表示,以识别不同的可达拼接目标。随后,我们采用基于动力学的拼接规划器,通过 Rollout Deviation Feedback(定义为目标状态序列与实际到达状态序列之间的差距,是通过执行预测动作实现)来自适应生成连接动作序列,以提高轨迹拼接的可行性和可达性。该方法通过拼接实现有效的数据增强,从而提升策略学习。ASTRO 在各种算法上均优于先前的离线 RL 数据增强方法,在具有挑战性的 OGBench 测试套件上实现显著性能提升,并在标准离线 RL 数据集(如 D4RL)上表现出一致的改进。
引用
@article{arxiv.2511.23442,
title = {ASTRO: Adaptive Stitching via Dynamics-Guided Trajectory Rollouts},
author = {Hang Yu and Di Zhang and Qiwei Du and Yanping Zhao and Hai Zhang and Guang Chen and Eduardo E. Veas and Junqiao Zhao},
journal= {arXiv preprint arXiv:2511.23442},
year = {2025}
}