ReTac-ACT:一种面向精密装配的数值-触觉注意力融合变换器
机器人学
2026-03-19 v2
摘要
精密装配需要在接触密集的“最后毫米”区域进行亚毫米级校正,由于末端执行器和工件遮挡,视觉反馈常常失效。我们提出ReTac-ACT(Reconstruction-enhanced Tactile ACT),一种视觉-触觉模仿学习策略,通过三种协同机制解决上述挑战:(i)双向交叉注意力机制,在特征融合前实现视觉-触觉特征的相互增强;(ii)基于机器人自身状态的门控网络,在视觉遮挡发生时动态提升触觉依赖性;(iii)触觉重构目标,引导学习与操作相关的接触信息而非通用视觉纹理。该方法在标准化的NIST装配任务板M1基准测试上实现了90%的插针成功率,显著优于视觉-only方法和通用基线方法,并在工业级0.1mm间隙下保持80%的成功率。消融实验验证了每个结构组件均不可或缺。ReTac-ACT代码库及覆盖多种间隙级别的视觉-触觉演示数据集将公开,以支持可重复的研究。
引用
@article{arxiv.2603.09565,
title = {ReTac-ACT: A State-Gated Vision-Tactile Fusion Transformer for Precision Assembly},
author = {Minchi Ruan and LiangQing Zhou and Hongtong Li and Zongtao Wang and ZhaoMing Lu and Jianwei Zhang and Bin Fang},
journal= {arXiv preprint arXiv:2603.09565},
year = {2026}
}