中文

早融合或晚融合至关重要:视觉Transformer中用于三维目标识别的高效RGB-D融合

计算机视觉与模式识别 2023-03-08 v2 机器人学

摘要

Vision Transformer (ViT) 架构已在计算机视觉文献中确立了其地位,然而,为RGB-D目标识别训练ViT仍是一个研究不足的话题,近期文献仅通过多视觉模态的多任务预训练视角来审视它。此类方法通常计算密集,依赖多个预训练数据集的规模来对齐RGB与三维信息。在本工作中,我们提出了一种简单而强大的方案,用于将预训练的ViT迁移到RGB-D领域以进行三维目标识别,重点在于融合由ViT联合编码的RGB与深度表示。与多模态Transformer的先前工作相比,此处的关键挑战是利用ViT公认灵活性在下游而非预训练阶段捕获跨模态交互。我们探索了哪种深度表示在最终精度上更优,并比较了在ViT架构内对齐RGB与深度模态的早融合与晚融合技术。在Washington RGB-D Objects数据集 (ROD) 上的实验结果表明,在此类RGB -> RGB-D场景中,晚融合技术优于最普遍采用的早融合。借助我们的迁移基线,融合ViT在ROD中取得了高达95.4%的top-1精度,在该基准上实现了新的state-of-the-art结果。我们进一步展示了在ROD基准的合成到真实视觉适配以及开放式终身学习场景中,使用我们的多模态融合基线相对于单模态特征提取器的优势,其中我们的模型以>8%的差距优于先前工作。最后,我们将我们的方法集成到机器人框架中,并展示了它如何在交互式机器人学习场景中作为感知工具发挥作用,无论是在仿真中还是使用真实机器人。

关键词

引用

@article{arxiv.2210.00843,
  title  = {Early or Late Fusion Matters: Efficient RGB-D Fusion in Vision Transformers for 3D Object Recognition},
  author = {Georgios Tziafas and Hamidreza Kasaei},
  journal= {arXiv preprint arXiv:2210.00843},
  year   = {2023}
}

备注

Submitted IROS 23. Supplementary video here: https://youtu.be/L2gkDPkHsfo