中文

面向多标签图像识别的语义感知图匹配机制

计算机视觉与模式识别 2023-04-25 v1

摘要

多标签图像识别旨在预测图像中出现的一组标签。处理该问题的关键在于挖掘图像内容与标签之间的关联,并进一步获得图像与其标签之间的正确匹配。本文将每幅图像视为实例包,并将多标签图像识别任务形式化为实例-标签匹配选择问题。为建模该问题,我们提出了一种创新的面向多标签图像识别的语义感知图匹配框架(ML-SGM),其中引入了图匹配机制,因其在挖掘实例与标签关系方面表现良好。该框架通过建模内容感知(实例)与语义感知(标签)类别表示之间的关系,显式建立类别相关性和实例-标签对应关系,以促进多标签图像理解并减少对每个类别大量训练样本的依赖。具体而言,我们首先分别构建实例空间图和标签语义图,然后通过将所有实例连接至所有标签将其并入所构建的分配图中。随后,采用图网络块聚合并更新分配图上所有节点和边的状态,以形成每个实例和标签的结构化表示。我们的网络最终导出每个实例-标签对应的预测分数,并以加权交叉熵损失优化该对应。在通用多标签图像识别上的实证结果表明了我们所提方法的优越性。此外,所提方法在部分标签多标签识别和少样本多标签学习中也展现出优势,并以明显优势超越当前最先进方法。

关键词

引用

@article{arxiv.2304.11275,
  title  = {Semantic-Aware Graph Matching Mechanism for Multi-Label Image Recognition},
  author = {Yanan Wu and Songhe Feng and Yang Wang},
  journal= {arXiv preprint arXiv:2304.11275},
  year   = {2023}
}

备注

Accepted by IEEE Transactions on Circuits and Systems for Video Technology (2023). arXiv admin note: text overlap with arXiv:2104.14762