中文

用于多标签图像识别的注意力驱动动态图卷积网络

计算机视觉与模式识别 2020-12-08 v1

摘要

近期研究常利用图卷积网络(GCN)建模标签依赖关系以提升多标签图像识别的准确率。然而,通过统计训练数据的标签共现可能性来构图会削弱模型泛化能力,尤其在测试图像中存在偶发共现物体时。我们的目标是消除此类偏置并增强所学特征的鲁棒性。为此,我们提出注意力驱动动态图卷积网络(ADD-GCN)为每幅图像动态生成特定图。ADD-GCN 采用动态图卷积网络(D-GCN)来建模由语义注意力模块(SAM)生成的内容感知类别表示之间的关系。在公开多标签基准上的大量实验证明了方法的有效性,其在 MS-COCO、VOC2007 和 VOC2012 上分别取得 85.2%、96.0% 和 95.5% 的 mAP,并以明显优势超越当前最先进方法。所有代码见 https://github.com/Yejin0111/ADD-GCN。

关键词

引用

@article{arxiv.2012.02994,
  title  = {Attention-Driven Dynamic Graph Convolutional Network for Multi-Label Image Recognition},
  author = {Jin Ye and Junjun He and Xiaojiang Peng and Wenhao Wu and Yu Qiao},
  journal= {arXiv preprint arXiv:2012.02994},
  year   = {2020}
}

备注

This paper has been accepted by ECCV 2020 (Source codes have been released on https://github.com/Yejin0111/ADD-GCN