MVT:用于三维物体识别的多视图视觉 Transformer
计算机视觉与模式识别
2021-10-26 v1
摘要
受 CNN 在图像识别中取得巨大成功的启发,基于视图的方法将 CNN 应用于建模投影视图以实现三维物体理解,并取得了优异性能。然而,多视图 CNN 模型无法建模来自不同视图的块之间的通信,限制了其在三维物体识别中的有效性。受视觉 Transformer 近期在图像识别中获成功的启发,我们提出一种用于三维物体识别的多视图视觉 Transformer(MVT)。由于 Transformer 块中的每个块特征具有全局感受野,它自然实现了来自不同视图的块之间的通信。同时,与 CNN 对应方法相比,它所需的归纳偏置少得多。兼顾有效性与效率,我们为 MVT 设计了全局-局部结构。在 ModelNet40 和 ModelNet10 两个公开基准上的实验证明了我们 MVT 的竞争性性能。
引用
@article{arxiv.2110.13083,
title = {MVT: Multi-view Vision Transformer for 3D Object Recognition},
author = {Shuo Chen and Tan Yu and Ping Li},
journal= {arXiv preprint arXiv:2110.13083},
year = {2021}
}
备注
BMVC 2021