视觉强化学习中的多模态融合用于 Sim2Real 迁移
计算机视觉与模式识别
2026-05-21 v4 机器人学
摘要
深度信息对场景外观变化具有鲁棒性,并且本质上携带着 3D 空间细节。因此,本文提出基于视觉 Transformer 的视觉主干来融合 RGB 和深度模态,以增强泛化能力。首先,不同模态通过独立的 CNN 干 stem 处理,然后将组合卷积特征输送给可扩展的视觉 Transformer 以获得视觉表示。此外,设计了一种对比学习方案,利用遮蔽和非遮蔽标记来增强样本效率和泛化性能。采用基于课程的域随机化方案以灵活稳定训练过程。最后,仿真结果表明,我们的融合方案超越了其他基线。我们的模型经过验证,可用于通过零样本迁移执行真实世界的操作任务。
引用
@article{arxiv.2507.09180,
title = {Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning},
author = {Zichun Xu and Jingdong Zhao and Chenyu Guo and Qianxue Zhang and Liao Zhang and Xiao Zhang and Yiming Ren and Lian Zhang and Zengren Zhao},
journal= {arXiv preprint arXiv:2507.09180},
year = {2026}
}