GelFusion:通过视觉-触觉融合增强受视觉约束下的机器人操作
机器人学
2025-05-13 v1
摘要
视觉-触觉感知提供丰富的接触信息,可有助于缓解仿真学习中性能瓶颈,尤其是在视觉受限的情况下,如模糊的视觉线索或遮挡。然而,有效地融合视觉和视觉-触觉模态仍面临持续的挑战。我们提出了 GelFusion 框架,以整合视觉-触觉反馈来增强策略,具体使用来自高分辨率 GelSight 传感器的视觉-触觉信息。GelFusion 采用以视觉为主导的跨注意力融合机制,将视觉-触觉信息纳入策略学习。为了提供丰富的接触信息,框架的核心组件是我们的双通道视觉-触觉特征表示,同时利用纹理几何特征和动态交互特征。我们在三个充满接触的任务上评估了 GelFusion:表面擦拭、插针和fragile 物体抓取和放置。在基线方法之上,GelFusion 显示出其结构在提高策略学习成功率方面的价值。
引用
@article{arxiv.2505.07455,
title = {GelFusion: Enhancing Robotic Manipulation under Visual Constraints via Visuotactile Fusion},
author = {Shulong Jiang and Shiqi Zhao and Yuxuan Fan and Peng Yin},
journal= {arXiv preprint arXiv:2505.07455},
year = {2025}
}