基于键控漂移场的轨迹扩散 amortization
微分几何
2026-03-17 v1
摘要
扩散式轨迹规划器能够合成离线强化学习中丰富的多模态动作序列,但其迭代去噪过程在推理时造成较大的计算成本,在有限算力预算下导致闭环规划速度较慢。我们研究如何在保持能够从条件状态采样 diverse 候选计划并在 receding-horizon 控制循环中对当前状态进行条件控制的前提下,以单步推理实现类似扩散的轨迹规划行为。我们的关键观察是,当用于对齐生成轨迹与数据集相似度的度量方式受到未受约束的未来维度主导时,条件生成会在na"ive分布匹配目标下失败。这在实践中导致趋向平均轨迹、动作多样性崩溃以及近乎静态行为。我们的关键洞察是,条件生成式规划需要一种条件感知的邻域概念:轨迹更新应使用反映条件的紧凑键空间中的距离来计算,同时仍在完整轨迹空间中应用更新。基于此,我们引入了基于键控漂移场的轨迹生成器(KDP),这是一种以漂移场目标训练的单步轨迹生成器,该目标吸引生成的轨迹靠近与条件匹配的数据集窗口,并在附近生成样本之间产生排斥作用,利用stop-gradient漂移目标将迭代细化 amortization 到训练中。在推理阶段,生成的策略能够在单次前向传播中产生完整的轨迹窗口。跨越标准RL基准测试和实时硬件部署,KDP在单步推理方面实现了强性能,显著低于扩散采样的规划延迟。项目网站、代码和视频: https://keyed-drifting.github.io/
引用
@article{arxiv.2603.14055,
title = {Renormalized Area of Hypersurfaces in Hyperbolic Spaces},
author = {Alvaro Pampano},
journal= {arXiv preprint arXiv:2603.14055},
year = {2026}
}