面向极罕见或未见类别的跨模态与模态内联合标签迁移
计算机视觉与模式识别
2017-03-23 v1
摘要
在本文中,我们提出了一种用于图像分类任务的从文本到图像的标签迁移模型。图像分类问题通常比文本分类更具挑战性。一方面,对于分类任务,带标签的文本数据比带标签的图像更易获取。另一方面,文本数据具有天然的语义可解释性,且通常与类别标签更直接相关。相反,图像特征与类别标签中固有的概念并无直接关联。本文的目标之一是开发一个模型来揭示文本与图像特征之间的函数关系,从而直接进行跨模态与模态内标签迁移以标注图像。这是通过学习一个迁移函数作为桥梁,在两个多模态空间之间传播标签来实现的。然而,盲目迁移噪声文本的标签来标注图像可能会削弱跨模态标签迁移的效果。为了缓解这一问题,我们提出了一种模态内标签迁移过程,当源语料库中缺少相关文本时,通过迁移图像标签来补充跨模态标签迁移。此外,我们将跨模态标签迁移推广至零样本学习场景,在该场景中仅有文本示例可用,以标注没有任何正图像示例的未见图像类别。我们在图像分类任务上评估了我们的算法,并展示了其相对于其他对比算法的有效性。
引用
@article{arxiv.1703.07519,
title = {Joint Intermodal and Intramodal Label Transfers for Extremely Rare or Unseen Classes},
author = {Guo-Jun Qi and Wei Liu and Charu Aggarwal and Thomas Huang},
journal= {arXiv preprint arXiv:1703.07519},
year = {2017}
}
备注
The paper has been accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence. It will apear in a future issue