中文

面向多标签图像识别的判别性表示学习

计算机视觉与模式识别 2021-07-26 v1

摘要

多标签识别是计算机视觉中一项基础且极具挑战性的任务。近期,深度学习模型在从输入图像中学习判别性特征方面取得了巨大进展。然而,传统方法无法对多标签图像中特征间的类间差异进行建模,因为它们被设计用于图像级别的特征判别。在本文中,我们提出一个统一的深度网络来为多标签任务学习判别性特征。给定一张多标签图像,所提方法首先解耦对应不同类别的特征。然后,通过在输出空间中增大类间距离并减小类内差异,对这些类别进行判别。通过使用所提损失对整个网络进行正则化,应用著名的 ResNet-101 的性能得到了显著提升。在 COCO-2014、VOC2007 和 VOC2012 数据集上进行了大量实验,结果表明所提方法在大规模 COCO 数据集上以 3.5% 的显著优势优于 SOTA 方法。此外,对判别性特征学习方法的分析表明,它可以作为一个通用模块插入到各种类型的多标签方法中。

关键词

引用

@article{arxiv.2107.11159,
  title  = {Learning Discriminative Representations for Multi-Label Image Recognition},
  author = {Mohammed Hassanin and Ibrahim Radwan and Salman Khan and Murat Tahtali},
  journal= {arXiv preprint arXiv:2107.11159},
  year   = {2021}
}