中文

将头部链接到“喙”:基于噪声文本描述在部分精度上的零样本学习

计算机视觉与模式识别 2017-09-06 v1

摘要

本文研究从非结构化文本描述中以部分精度学习视觉分类器,且无需训练图像。我们提出一种学习框架,能够在没有任何部分-文本标注的情况下,将文本术语连接到其相关部分,并抑制与非视觉文本术语的连接。例如,该学习过程使得像“beak(喙)”这样的术语能够稀疏地链接到像头部这样的部分视觉表示,同时降低像“migrate(迁徙)”这样的非视觉术语对分类器预测的影响。图像由基于部分的CNN编码,该CNN检测鸟类部分并学习部分特定的表示。基于部分的视觉分类器由未见视觉分类器的文本描述预测,以促进无训练图像的分类(也称为零样本识别)。我们在CUBirds 2011数据集上进行了实验,将最先进的基于文本的零样本识别结果从34.7%提高到43.6%。我们还创建了增强文本描述的北美鸟类图像大规模基准,其中我们也展示了我们的方法优于现有方法。我们的代码、数据和模型公开可用。

关键词

引用

@article{arxiv.1709.01148,
  title  = {Link the head to the "beak": Zero Shot Learning from Noisy Text Description at Part Precision},
  author = {Mohamed Elhoseiny and Yizhe Zhu and Han Zhang and Ahmed Elgammal},
  journal= {arXiv preprint arXiv:1709.01148},
  year   = {2017}
}

备注

Accepted by CVPR'17