LATFormer:用于三维形状识别的局部感知点-视图融合Transformer
计算机视觉与模式识别
2023-08-28 v2
摘要
近年来,由于深度学习模型在图像、体素和点云等多种数据格式上的进展,三维形状理解取得了显著进步。其中,点云和多视图图像是三维物体的两种互补模态,融合二者学习表征已被证明相当有效。先前工作通常侧重于利用两种模态的全局特征,而本文认为通过建模“在何处融合”可推导出更具判别力的特征。为此,我们提出一种新颖的局部感知点-视图融合Transformer(LATFormer)用于三维形状检索与分类。LATFormer的核心组件是一个名为局部感知融合(LAF)的模块,该模块基于共现分数整合两种模态中相关区域的局部特征。我们进一步提出过滤掉低分值以获得显著的局部共现区域,从而减少融合过程的冗余。在LATFormer中,我们利用LAF模块以双向且分层的方式融合两种模态的多尺度特征,以获取更具信息量的特征。在涵盖三维物体检索与分类的四个流行三维形状基准上的综合实验验证了其有效性。
引用
@article{arxiv.2109.01291,
title = {LATFormer: Locality-Aware Point-View Fusion Transformer for 3D Shape Recognition},
author = {Xinwei He and Silin Cheng and Dingkang Liang and Song Bai and Xi Wang and Yingying Zhu},
journal= {arXiv preprint arXiv:2109.01291},
year = {2023}
}