编写分类器:从非结构化文本预测视觉分类器
计算机视觉与模式识别
2016-12-30 v2 计算与语言
机器学习
摘要
人们通常通过接触与语言描述相关的视觉概念来学习。例如,向儿童教授视觉对象类别常伴随文本或语音描述。在机器学习背景下,这些观察促使我们思考这种学习过程是否可以被计算建模以学习视觉分类器。更具体地,本工作的主要问题是如何利用纯文本描述的视觉类别(无训练图像)来为它们学习显式的视觉分类器。我们提出并研究了两种基于回归和域转移的基线公式,用于预测线性分类器。然后,我们提出了一种新的约束优化公式,它结合回归函数和知识转移函数以及额外约束来预测线性分类器的参数。我们还提出了一种通用核化模型,其中核分类器以表示定理定义的形式预测。核化模型允许分别在视觉空间和文本空间中定义和利用任意两个RKHS(再生核希尔伯特空间)核函数。最后,我们提出了一种基于分布语义的非结构化文本描述之间的核函数,这在我们的设定中显示出优势,并可能用于其他应用。我们将所有研究的模型应用于在两个细粒度且具有挑战性的分类数据集(CU Birds 和 Flower Datasets)上预测视觉分类器,结果表明我们的最终模型相对于我们设计的几个基线取得了成功预测。
引用
@article{arxiv.1601.00025,
title = {Write a Classifier: Predicting Visual Classifiers from Unstructured Text},
author = {Mohamed Elhoseiny and Ahmed Elgammal and Babak Saleh},
journal= {arXiv preprint arXiv:1601.00025},
year = {2016}
}
备注
(TPAMI) Transactions on Pattern Analysis and Machine Intelligence 2017