利用 Sobolev 训练的扩散策略加速轨迹优化
机器学习
2026-05-29 v2 机器人学
摘要
轨迹优化(TO)求解器利用已知系统动力学,通过迭代改进计算出局部最优轨迹。其缺点是每个新问题实例独立求解,因此求解速度和解的质量依赖于初始轨迹的提议。为提高效率,一种自然做法是用在先前由求解器生成的轨迹上训练的已学习策略产生的初始猜测来 warm-start TO。近期涌现的扩散基于策略作为表征力的imitation学习模型,成为这一角色的有前景的候选者。然而,TO demonstrations 的局部最优性带来了一个反直觉的挑战:当策略滚动运行时,小的非最优偏差可能将其推入训练数据中未表示的情况,通过长期视角触发累积误差。本文聚焦于为 gradient-based TO 求解器进行基于学习的 warm-start,同时提供反馈增益。利用这种特性,我们推导了使用轨迹和反馈增益的扩散策略的 Sobolev 学习的 first-order loss。通过全面实验,我们展示所得策略可避免累积误差,因此能从极少的轨迹中学习,以提供降低求解时间 至 的初始猜测。融合一阶信息使预测在更少的扩散步骤中实现,从而降低推理延迟。
引用
@article{arxiv.2604.19011,
title = {Accelerating trajectory optimization with Sobolev-trained diffusion policies},
author = {Théotime Le Hellard and Franki Nguimatsia Tiofack and Quentin Le Lidec and Justin Carpentier},
journal= {arXiv preprint arXiv:2604.19011},
year = {2026}
}