中文

利用文本描述预测深度零样本卷积神经网络

机器学习 2015-09-28 v2 计算机视觉与模式识别 神经与进化计算

摘要

视觉类别的零样本学习(Zero-Shot Learning)的主要挑战之一是收集伴随图像的语义属性。近期工作表明,从文本描述(如维基百科文章)中学习可避免显式定义这些属性的问题。我们提出一种新模型,可根据文本描述对未见过的类别进行分类。具体而言,我们利用文本特征来预测深度卷积神经网络(CNN)中卷积层和全连接层的输出权重。我们利用 CNN 的架构,在不同层学习特征,而非像现有方法那样仅为两种模态学习一个嵌入空间。所提模型还允许我们自动生成每个视觉类别的伪属性列表,这些伪属性由维基百科文章中的词组成。我们使用 Caltech-UCSD 鸟类和花卉数据集端到端训练模型,并评估 ROC 与精确率-召回率(Precision-Recall)曲线。我们的实证结果表明所提模型显著优于先前方法。

关键词

引用

@article{arxiv.1506.00511,
  title  = {Predicting Deep Zero-Shot Convolutional Neural Networks using Textual Descriptions},
  author = {Jimmy Ba and Kevin Swersky and Sanja Fidler and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:1506.00511},
  year   = {2015}
}

备注

Correct the typos in table 1 regarding [5]. To appear in ICCV 2015