WarmPrior:利用时序先验直化流匹配策略
机器学习
2026-05-15 v1 人工智能
机器人学
摘要
基于扩散和流匹配的生成策略已成为视觉-运动控制领域的主导范式。我们表明,用从最近动作历史中轻松获取的时序先验(WarmPrior)取代标准高斯源分布,能在机器人操纵任务中持续提升成功率。我们将这一提升归因于概率路径显著变直,这呼应了矩形流中最优传输耦合的作用。除标准行为克隆外,WarmPrior 还重塑了先验空间强化学习中的探索分布,提高了样本效率和最终性能。总体而言,这些结果表明,源分布是生成式机器人控制中一个重要且充实探索的设计轴。
引用
@article{arxiv.2605.13959,
title = {WarmPrior: Straightening Flow-Matching Policies with Temporal Priors},
author = {Sinjae Kang and Chanyoung Kim and Kaixin Wang and Li Zhao and Kimin Lee},
journal= {arXiv preprint arXiv:2605.13959},
year = {2026}
}