中文

VO-DP:面向视觉单视图的语义几何自适应扩散策略

机器人学 2025-11-04 v4 计算机视觉与模式识别 机器学习

摘要

在模仿学习领域,基于视觉的扩散策略学习是机器人操作控制的主要方向之一。大多数方法依赖点云作为观测输入,通过点云特征学习构建场景表示,从而实现卓越的精度。然而,现有文献缺乏对具有显著潜力的视觉单视图解决方案的深入探索。本文提出一种视觉单视图扩散策略学习方法(VO-DP),利用预训练的视觉基础模型实现语义与几何特征的有效融合。我们利用VGGT中集成DINOv2语义特征和交替注意力块几何特征的中间特征。通过跨注意力融合特征,并通过CNN进行空间压缩,构成策略头的输入。大量实验表明,VO-DP不仅显著优于视觉单视图基线方法DP,还在仿真任务中实现64.6%的平均成功率,与DP3的64.0%持平,远高于DP的34.8%;在实际任务中达到87.9%,显著优于DP3的67.5%和DP的11.2%。进一步的鲁棒性评估确认,VO-DP在颜色、尺寸、背景和光照等不同条件下均表现出极高的稳定性。最后,我们开源了一个用于机器人操作的训练库。基于Accelerate,该库支持多机多GPU并行训练以及混合精度训练,兼容DP、DP3和VO-DP等视觉运动策略,同时支持RoboTwin仿真器。

关键词

引用

@article{arxiv.2510.15530,
  title  = {VO-DP: Semantic-Geometric Adaptive Diffusion Policy for Vision-Only Robotic Manipulation},
  author = {Zehao Ni and Yonghao He and Lingfeng Qian and Jilei Mao and Fa Fu and Wei Sui and Hu Su and Junran Peng and Zhipeng Wang and Bin He},
  journal= {arXiv preprint arXiv:2510.15530},
  year   = {2025}
}