中文

Surformer v2:基于触觉与视觉的表面理解多模态分类器

机器人学 2025-09-08 v1

摘要

多模态表面材质分类在推进机器人操作与交互的触觉感知中发挥关键作用。本文提出 Surformer v2,一种增强的多模态分类架构,旨在通过后期(决策级)融合机制整合视觉与触觉感知流。在我们早期采用手工特征提取并结合多头交叉注意力层进行中期融合的 Surformer v1 框架[1]基础上,Surformer v2 将特征提取过程集成于模型内部并转向后期融合。视觉分支利用基于 CNN 的分类器(Efficient V-Net),触觉分支采用仅编码器的 Transformer 模型,使每种模态能提取针对分类优化的模态特定特征。该模型不合并特征图,而是通过可学习的加权和组合输出 logits 进行决策级融合,从而能根据数据上下文和训练动态自适应地强调各模态。我们在 Touch and Go 数据集[2]上评估 Surformer v2,该多模态基准包含表面图像及相应的触觉传感器读数。结果表明 Surformer v2 表现良好,保持有竞争力的推理速度,适用于实时机器人应用。这些发现凸显了决策级融合与基于 Transformer 的触觉建模在增强多模态机器人感知中表面理解的有效性。

关键词

引用

@article{arxiv.2509.04658,
  title  = {Surformer v2: A Multimodal Classifier for Surface Understanding from Touch and Vision},
  author = {Manish Kansana and Sindhuja Penchala and Shahram Rahimi and Noorbakhsh Amiri Golilarz},
  journal= {arXiv preprint arXiv:2509.04658},
  year   = {2025}
}

备注

6 pages