中文

利用混合多模态 Vision Transformer-CNN 模型增强细粒度三维物体识别

计算机视觉与模式识别 2023-03-07 v2 人工智能

摘要

在以人为中心的环境(如零售店、餐厅和家庭)中运行的机器人,常需在不同场景下以高精度区分相似物体。然而,由于类内差异大、类间差异小,细粒度物体识别在机器人领域仍具挑战。此外,细粒度三维数据集的匮乏给有效解决该问题带来了显著困难。本文提出一种混合多模态 Vision Transformer (ViT) 与卷积神经网络 (CNN) 方法,以提升细粒度视觉分类 (FGVC) 性能。为弥补 FGVC 三维数据集的不足,我们生成了两个合成数据集。第一个数据集包含与餐厅相关的 20 个类别共 100 个实例,第二个数据集包含 120 个鞋类实例。我们的方法在两个数据集上进行了评估,结果表明其优于仅用 CNN 和仅用 ViT 的基线,在餐厅和鞋类数据集上分别取得了 94.50% 和 93.51% 的识别准确率。此外,我们已向研究界开放 FGVC RGB-D 数据集,以促进进一步实验与进展。我们还将所提方法成功集成至机器人框架,并在仿真与真实机器人场景中展示了其作为细粒度感知工具的潜力。

关键词

引用

@article{arxiv.2210.04613,
  title  = {Enhancing Fine-Grained 3D Object Recognition using Hybrid Multi-Modal Vision Transformer-CNN Models},
  author = {Songsong Xiong and Georgios Tziafas and Hamidreza Kasaei},
  journal= {arXiv preprint arXiv:2210.04613},
  year   = {2023}
}