ViTaPEs:用于多模态 Transformer 中跨模态对齐的视触位置编码
计算机视觉与模式识别
2026-04-30 v3 机器学习
机器人学
摘要
触觉感知提供了对视觉感知互补的局部基本信息,如纹理、柔顺性和力。尽管视触觉表征学习最近取得了进展,但在融合这些模态以及在无需严重依赖预训练视觉-语言模型的情况下跨任务和环境泛化方面仍存在挑战。此外,现有方法没有研究位置编码,从而忽略了捕获细粒度视触觉相关性所需的多阶段空间推理。我们引入了 ViTaPEs,这是一种基于 Transformer 的架构,用于从成对的视觉和触觉输入中学习与任务无关的视触觉表征。我们的核心思想是两阶段位置注入:在每个流内部添加局部(特定于模态的)位置编码,并在注意力机制之前立即添加到联合 token 序列上的全局位置编码,从而在发生跨模态交互的阶段提供共享的位置词汇。我们明确了位置注入点,并进行了受控消融实验,以隔离它们在逐 token 非线性之前与紧接在自注意力之前的效果差异。在多个大规模真实世界数据集上的实验表明,ViTaPEs 不仅在各种识别任务中超越了 SOTA 基线,还展示了对未见、域外场景的零样本泛化能力。我们进一步在机器人抓取任务中展示了 ViTaPEs 的迁移学习优势,其在预测抓取成功方面优于 SOTA 基线。项目页面:https://sites.google.com/view/vitapes
引用
@article{arxiv.2505.20032,
title = {ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers},
author = {Fotios Lygerakis and Ozan Özdenizci and Elmar Rückert},
journal= {arXiv preprint arXiv:2505.20032},
year = {2026}
}