中文

NOVUM:用于鲁棒对象分类的神经对象体表示

计算机视觉与模式识别 2024-08-29 v4

摘要

用于对象分类的判别模型通常学习基于图像的表示,这些表示未能捕捉对象的组合性与三维本质。在本工作中,我们表明将三维组合对象表示显式地整合进用于图像分类的深度网络中,可在分布外场景下大幅提升泛化能力。具体而言,我们引入一种称为 NOVUM 的新颖架构,其由特征提取器与针对每个目标对象类的神经对象体组成。每个神经对象体是由发射特征向量的三维高斯分布组成的组合。这种组合对象表示通过独立地将每一类的三维高斯特征与从输入图像提取的特征进行匹配,实现了高度鲁棒且快速的对象类估计。此外,可通过相应神经对象体的逆渲染来估计对象姿态。为使对象分类成为可能,每个三维高斯处的神经特征被判别式地训练为区别于 (i) 其他类别中三维高斯的特征,(ii) 同一对象其他三维高斯的特征,以及 (iii) 背景特征。我们的实验表明,由于对象表示的三维组合结构,NOVUM 相较标准架构具有引人注目的优势,即:(1) 在一系列真实世界与合成分布外偏移中表现出 exceptional 的鲁棒性;(2) 相较标准模型增强了人类可解释性,同时在分布内数据上保持实时推理与具竞争力的准确率。

关键词

引用

@article{arxiv.2305.14668,
  title  = {NOVUM: Neural Object Volumes for Robust Object Classification},
  author = {Artur Jesslen and Guofeng Zhang and Angtian Wang and Wufei Ma and Alan Yuille and Adam Kortylewski},
  journal= {arXiv preprint arXiv:2305.14668},
  year   = {2024}
}

备注

14 pages, 4 figures, accepted at ECCV 2024, code is accessible at https://github.com/GenIntel/NOVUM