中文

CIGMO:深度生成框架中的类别不变表示

计算机视觉与模式识别 2022-05-30 v1 人工智能 机器学习

摘要

通用物体图像数据具有两种最常见结构:(1)给定形状的每个物体可在多种不同视角下渲染;(2)物体形状可按类别划分,使得类别间的形状多样性远大于类别内。现有深度生成模型通常只能捕捉其中一种结构,而非两者。本工作中,我们提出一种称为CIGMO的新型深度生成模型,可学习从图像数据中表示类别、形状和视角因子。该模型由多个形状表示模块组成,每个模块专用于特定类别并与视角表示解耦,可使用基于组的弱监督学习方法进行训练。通过实证调研,我们表明我们的模型能有效发现物体形状类别,尽管存在较大视角变化,并在定量上超越包括最先进不变聚类算法在内的多种先前方法。此外,我们展示了这种使用类别专门化的方法可增强所学形状表示,以更好地执行下游任务,如一次性物体识别以及形状-视角解耦。

关键词

引用

@article{arxiv.2205.13758,
  title  = {CIGMO: Categorical invariant representations in a deep generative framework},
  author = {Haruo Hosoya},
  journal= {arXiv preprint arXiv:2205.13758},
  year   = {2022}
}