中文

改进用于多标签图像分类的成对排序

计算机视觉与模式识别 2017-06-02 v3

摘要

学习排序最近已成为一种有吸引力的技术,用于训练深度卷积神经网络以完成各种计算机视觉任务。特别是,成对排序在多标签图像分类中取得了成功,在各种基准上达到了最先进的成果。然而,大多数现有方法使用铰链损失(hinge loss)来训练其模型,该损失非光滑,因此难以优化,尤其是与深度网络结合时。此外,它们采用简单的启发式方法,例如top-k或阈值化,从排序的标签列表中确定输出中包含哪些标签,这限制了它们在真实场景中的使用。在这项工作中,我们提出两种技术来改进基于成对排序的多标签图像分类:(1)我们提出一种用于成对排序的新颖损失函数,该函数在各处光滑,因此更易于优化;(2)我们将标签决策模块整合到模型中,为每个视觉概念估计最优置信度阈值。我们在贝叶斯一致性和风险最小化框架下对我们的损失函数进行了理论分析,并展示了其相对于现有成对排序公式的优势。我们在三个大规模数据集VOC2007、NUS-WIDE和MS-COCO上证明了我们方法的有效性,取得了文献中报道的最佳结果。

关键词

引用

@article{arxiv.1704.03135,
  title  = {Improving Pairwise Ranking for Multi-label Image Classification},
  author = {Yuncheng Li and Yale Song and Jiebo Luo},
  journal= {arXiv preprint arXiv:1704.03135},
  year   = {2017}
}

备注

cvpr 2017