中文

内部调修:基于网络手术的交互式零样本学习

计算机视觉与模式识别 2016-12-16 v1

摘要

我们考虑视觉网络手术的任务,其中 CNN 可在无额外数据情况下被重新配置以识别训练集中可能遗漏的新概念。尽管多数先前工作利用语言线索进行此类“零样本”学习,我们则通过使用由 CNN 隐式学习的训练集的图像语言表示来泛化至新类别。为此,我们引入一组可视化技术,以更好地揭示 CNN 滤波器组之间的激活模式与关系。我们随后证明,图像语言的知识可用于将某些 CNN 神经元重连为一个部件模型,我们称之为图像语言分类器(pictorial language classifier, PLC)。我们通过以弱监督方式应用简单 PLC 来展示其鲁棒性:为训练数据中存在的视觉类别标注未标记概念。具体地,我们展示构建于 ImageNet 分类训练 CNN 之上的 PLC 能够在无额外标记数据或附加训练的情况下,定位 Graz-02 中的人类并确定 PASCAL-VOC 中鸟类的姿态。我们随后以交互式零样本方式应用 PLC,证明图像语言具有足够表达能力以检测 MS-COCO 中一组从未出现在 ImageNet 训练集中的视觉类别。

关键词

引用

@article{arxiv.1612.04901,
  title  = {Tinkering Under the Hood: Interactive Zero-Shot Learning with Net Surgery},
  author = {Vivek Krishnan and Deva Ramanan},
  journal= {arXiv preprint arXiv:1612.04901},
  year   = {2016}
}