中文

基于非均匀时间调度的稠密跳跃流匹配用于机器人策略:缓解多步推理衰减

机器人学 2026-03-03 v2 人工智能

摘要

流匹配已成为机器人领域学习高质量生成策略的有竞争力框架;然而,我们发现一般化在流轨迹上早期即出现并饱和,与最新文献发现一致。我们进一步观察到,在推理过程中增加欧拉积分步数,反而普遍地降低策略性能。我们将其归因于:(i)额外的均匀间隔积分步骤会过采样late-time区域,从而将动作约束在训练轨迹上,降低一般化;(ii)随着积分时间接近1,学习到的速度场变得非 Lipschitz,导致不稳定。为解决这些问题,我们提出一种新策略,利用训练中的非均匀时间调度(例如U型),以强调早期和晚期时间阶段进行正则化训练;并在推理中采用稠密跳跃积分调度,超过跳跃点后使用单步积分取代多步积分,以避免以1为中心的不稳定区域。本质上,我们的策略是一个高效的单步学习者,仍通过多步积分推进性能,在多样化机器人任务上实现最高可达23.7%的性能提升。

关键词

引用

@article{arxiv.2509.13574,
  title  = {Dense-Jump Flow Matching with Non-Uniform Time Scheduling for Robotic Policies: Mitigating Multi-Step Inference Degradation},
  author = {Zidong Chen and Zihao Guo and Peng Wang and ThankGod Itua Egbe and Yan Lyu and Chenghao Qian},
  journal= {arXiv preprint arXiv:2509.13574},
  year   = {2026}
}