中文

PatchCT:用条件传输对齐图像块集与标签集的多标签图像分类

计算机视觉与模式识别 2023-08-21 v2

摘要

多标签图像分类是一种从给定图像中识别多个标签的预测任务。本文考虑视觉块与语言标签域之间潜在空间的语义一致性,并引入条件传输(CT)理论来弥合公认的鸿沟。尽管近期基于交叉模态注意力的研究试图对齐这两种表示并取得了令人印象深刻的性能,但它们在注意力计算中需要精心设计的对齐模块和额外的复杂操作。我们发现,通过将多标签分类表述为CT问题,可通过最小化双向CT代价高效利用图像与标签间的交互。具体而言,在将图像和文本标签输入模态特定编码器后,我们将每幅图像视为块嵌入的混合和标签嵌入的混合,分别捕获局部区域特征和类原型。然后采用CT通过定义前向和后向导航器来学习并对齐这两个语义集合。重要的是,CT距离中定义的导航器建模了块与标签间的相似性,为可视化学习到的原型提供了可解释工具。在三个公开图像基准上的大量实验表明,所提模型一致优于先前方法。

关键词

引用

@article{arxiv.2307.09066,
  title  = {PatchCT: Aligning Patch Set and Label Set with Conditional Transport for Multi-Label Image Classification},
  author = {Miaoge Li and Dongsheng Wang and Xinyang Liu and Zequn Zeng and Ruiying Lu and Bo Chen and Mingyuan Zhou},
  journal= {arXiv preprint arXiv:2307.09066},
  year   = {2023}
}

备注

accepted by ICCV23