GKGNet:基于分组 K 近邻图卷积网络的多标签图像识别
计算机视觉与模式识别
2024-07-22 v3
摘要
多标签图像识别(MLIR)旨在预测单幅图像中的多个物体标签,同时建模标签与图像区域间的复杂关系,是一项具挑战性的任务。尽管卷积神经网络与视觉 transformer 已成功将图像处理为规则像素或块网格,此类表示在捕获不规则且不连续感兴趣区域时并非最优。本文提出首个全图卷积模型——基于分组 K 近邻的图卷积网络(GKGNet),以灵活统一的图结构建模语义标签嵌入与图像块间的连接。为应对不同物体的尺度差异并从多视角捕获信息,我们提出分组 KGCN 模块用于动态图构建与消息传递。实验表明,GKGNet 在具挑战性的多标签数据集 MS-COCO 与 VOC2007 上以显著更低计算成本取得最优性能。代码见 https://github.com/jin-s13/GKGNet。
引用
@article{arxiv.2308.14378,
title = {GKGNet: Group K-Nearest Neighbor based Graph Convolutional Network for Multi-Label Image Recognition},
author = {Ruijie Yao and Sheng Jin and Lumin Xu and Wang Zeng and Wentao Liu and Chen Qian and Ping Luo and Ji Wu},
journal= {arXiv preprint arXiv:2308.14378},
year = {2024}
}
备注
Accepted by ECCV 2024