中文

从你看到的东西抽样:基于扩散桥接的观察嵌入式随机微分方程视觉运动策略学习

人工智能 2026-02-05 v2 机器学习

摘要

基于扩散模型的模仿学习已通过捕捉多模态动作分布推进了机器人控制,但现有方法通常仅将观察视为去噪网络的高层条件,而未将其整合到扩散过程本身的随机动力学中。结果,抽样被迫从随机噪声开始,削弱了感知与控制之间的耦合,往往导致次优性能。我们提出了BridgePolicy,一种将观察直接整合到随机动力学中的生成式视觉运动策略,采用扩散桥接 formulation。通过构建观察信息丰富且有启发性的先验,BridgePolicy使抽样能够从丰富的先验开始而非随机噪声,显著提高了控制的精度和可靠性。一个关键难点在于,扩散桥接通常连接维数匹配的分布,而机器人观察是异构的且天然不与动作对齐。为克服这一困难,我们引入了多模态融合模块和语义对齐器,将视觉和状态输入统一,并将观察与动作表示对齐,使扩散桥接适用于异构机器人数据。广泛的实验在三个基准测试中的52个仿真任务和5个真实世界任务中表明,BridgePolicy consistently优于最新的生成式策略。

关键词

引用

@article{arxiv.2512.07212,
  title  = {Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation},
  author = {Zhaoyang Liu and Mokai Pan and Zhongyi Wang and Kaizhen Zhu and Haotao Lu and Haipeng Zhang and Jingya Wang and Ye Shi},
  journal= {arXiv preprint arXiv:2512.07212},
  year   = {2026}
}