中文

面向部分标签多标签图像识别的双视角语义感知表征融合

计算机视觉与模式识别 2024-01-30 v3

摘要

尽管取得了令人瞩目的进展,当前的多标签图像识别(MLR)算法严重依赖带有完整标签的大规模数据集,使得大规模数据集的收集极为耗时耗力。利用部分标签训练多标签图像识别模型(MLR-PL)是一种替代方案,其中每幅图像仅有部分标签已知而其他标签未知。然而,当前的 MLR-PL 算法依赖预训练的图像相似度模型或迭代更新图像分类模型来为未知标签生成伪标签。因此,它们依赖一定数量的标注,并且不可避免地遭受明显的性能下降,尤其在已知标签比例较低时。为应对这一困境,我们提出一种双视角语义感知表征融合(DSRB),从不同图像的实例与原型视角分别融合多粒度类别特定语义表征,以将已知标签的信息传递并补全未知标签。具体而言,设计了一个实例视角表征融合(IPRB)模块,将一幅图像中已知标签的表征与另一图像中对应未知标签的表征相融合,以补全这些未知标签。同时,引入一个原型视角表征融合(PPRB)模块,以位置敏感的方式为每个类别学习更稳定的表征原型,并将未知标签的表征与对应标签的原型相融合,以补全这些未知标签。在 MS-COCO、Visual Genome 和 Pascal VOC 2007 数据集上的大量实验表明,所提出的 DSRB 在所有已知标签比例设置下均一致优于当前最先进的算法。

关键词

引用

@article{arxiv.2205.13092,
  title  = {Dual-Perspective Semantic-Aware Representation Blending for Multi-Label Image Recognition with Partial Labels},
  author = {Tao Pu and Tianshui Chen and Hefeng Wu and Yukai Shi and Zhijing Yang and Liang Lin},
  journal= {arXiv preprint arXiv:2205.13092},
  year   = {2024}
}

备注

Technical Report. arXiv admin note: text overlap with arXiv:2203.02172