中文

解耦3D原型网络用于少样本概念学习

计算机视觉与模式识别 2021-07-22 v3

摘要

我们提出将RGB-D图像解耦为物体形状与风格以及背景场景图的神经架构,并探索其在少样本3D目标检测与少样本概念分类中的应用。我们的网络融入了反映图像形成过程、世界场景3D几何以及形状-风格相互作用的架构偏置。它们通过预测静态场景中的视图以及少量3D目标框进行端到端自监督训练。物体与场景在网络瓶颈处用3D特征网格表示。我们表明所提出的3D神经表示具有组合性:它们可通过混合物体形状与风格、缩放并将所得物体3D特征图叠加于背景场景特征图之上来生成新颖的3D场景特征图。我们表明,在解耦3D特征子空间上训练的物体类别、颜色、材质和空间关系分类器比当前最优方法以显著更少的样本泛化得更好,并赋能将其作为模块使用的视觉问答系统对场景中新颖物体实现一次性泛化。

关键词

引用

@article{arxiv.2011.03367,
  title  = {Disentangling 3D Prototypical Networks For Few-Shot Concept Learning},
  author = {Mihir Prabhudesai and Shamit Lal and Darshan Patil and Hsiao-Yu Tung and Adam W Harley and Katerina Fragkiadaki},
  journal= {arXiv preprint arXiv:2011.03367},
  year   = {2021}
}