中文

MVT:用于三维物体识别的多视图视觉 Transformer

计算机视觉与模式识别 2021-10-26 v1

摘要

受 CNN 在图像识别中取得巨大成功的启发,基于视图的方法将 CNN 应用于建模投影视图以实现三维物体理解,并取得了优异性能。然而,多视图 CNN 模型无法建模来自不同视图的块之间的通信,限制了其在三维物体识别中的有效性。受视觉 Transformer 近期在图像识别中获成功的启发,我们提出一种用于三维物体识别的多视图视觉 Transformer(MVT)。由于 Transformer 块中的每个块特征具有全局感受野,它自然实现了来自不同视图的块之间的通信。同时,与 CNN 对应方法相比,它所需的归纳偏置少得多。兼顾有效性与效率,我们为 MVT 设计了全局-局部结构。在 ModelNet40 和 ModelNet10 两个公开基准上的实验证明了我们 MVT 的竞争性性能。

关键词

引用

@article{arxiv.2110.13083,
  title  = {MVT: Multi-view Vision Transformer for 3D Object Recognition},
  author = {Shuo Chen and Tan Yu and Ping Li},
  journal= {arXiv preprint arXiv:2110.13083},
  year   = {2021}
}

备注

BMVC 2021