中文

LM-MCVT:面向 3D 物体识别的轻量级多模态多视角卷积-Vision Transformer 方法

计算机视觉与模式识别 2025-08-14 v3 机器人学

摘要

在餐厅、家庭和仓库等人类居住环境中,机器人常面临准确识别 3D 物体的挑战。这些挑战源于环境的复杂性和多样性,包括多样的物体形状。本文提出一种新型轻量级多模态多视角卷积-Vision Transformer 网络(LM-MCVT),以增强机器人应用中的 3D 物体识别。该方法利用全局熵基于嵌入融合(GEEF)方法高效整合多视角。LM-MCVT 架构集成低级和中级卷积编码器以及局部和全局 Transformer,以提升特征提取和识别精度。我们在合成 ModelNet40 数据集上进行评估,使用四视角配置实现了 95.6% 的识别准确率,超越现有前沿方法。为进一步验证其有效性,我们在同一配置下对真实世界 OmniObject3D 数据集进行 5 折交叉验证。结果始终显示出优异性能,证明该方法在合成和真实 3D 数据的 3D 物体识别中具有稳健性。

关键词

引用

@article{arxiv.2504.19256,
  title  = {LM-MCVT: A Lightweight Multi-modal Multi-view Convolutional-Vision Transformer Approach for 3D Object Recognition},
  author = {Songsong Xiong and Hamidreza Kasaei},
  journal= {arXiv preprint arXiv:2504.19256},
  year   = {2025}
}