中文

GelFusion:通过视觉-触觉融合增强受视觉约束下的机器人操作

机器人学 2025-05-13 v1

摘要

视觉-触觉感知提供丰富的接触信息,可有助于缓解仿真学习中性能瓶颈,尤其是在视觉受限的情况下,如模糊的视觉线索或遮挡。然而,有效地融合视觉和视觉-触觉模态仍面临持续的挑战。我们提出了 GelFusion 框架,以整合视觉-触觉反馈来增强策略,具体使用来自高分辨率 GelSight 传感器的视觉-触觉信息。GelFusion 采用以视觉为主导的跨注意力融合机制,将视觉-触觉信息纳入策略学习。为了提供丰富的接触信息,框架的核心组件是我们的双通道视觉-触觉特征表示,同时利用纹理几何特征和动态交互特征。我们在三个充满接触的任务上评估了 GelFusion:表面擦拭、插针和fragile 物体抓取和放置。在基线方法之上,GelFusion 显示出其结构在提高策略学习成功率方面的价值。

关键词

引用

@article{arxiv.2505.07455,
  title  = {GelFusion: Enhancing Robotic Manipulation under Visual Constraints via Visuotactile Fusion},
  author = {Shulong Jiang and Shiqi Zhao and Yuxuan Fan and Peng Yin},
  journal= {arXiv preprint arXiv:2505.07455},
  year   = {2025}
}