TRM-ML:用于带缺失标签的多标签图像识别的文本-区域匹配
计算机视觉与模式识别
2024-08-30 v3
摘要
最近,大规模视觉语言预训练(VLP)模型在各种下游任务中展现出惊人的性能。鼓舞人心地,针对带缺失标签的多标签图像识别,初步工作已涌现,利用 VLP 提示调谐技术。然而,这些方法通常无法很好地匹配文本和视觉特征,因为存在复杂的语义差距以及多标签图像中的缺失标签。为解决这一挑战,我们提出了文本-区域匹配以优化多标签提示调谐的方法,称为 TRM-ML。与现有方法相比,我们主张探索类别感知区域的信息,而非整个图像或像素,这有助于以一对一匹配方式弥合文本和视觉表征之间的语义差距。同时,我们进一步引入多模态对比学习以缩小文本和视觉模态之间的语义差距,并建立类内和类间关系。此外,为了处理缺失标签,我们提出一种多模态类别原型,利用类内和类间语义关系来估计未知标签,从而促进伪标签生成。在 MS-COCO、PASCAL VOC、Visual Genome、NUS-WIDE 和 CUB-200-211 等广泛的基准数据集上进行大量实验,证明我们提出的框架在显著优于最先进方法的性能。我们的代码可在此处获取:https://github.com/yu-gi-oh-leilei/TRM-ML。
引用
@article{arxiv.2407.18520,
title = {Text-Region Matching for Multi-Label Image Recognition with Missing Labels},
author = {Leilei Ma and Hongxing Xie and Lei Wang and Yanping Fu and Dengdi Sun and Haifeng Zhao},
journal= {arXiv preprint arXiv:2407.18520},
year = {2024}
}
备注
Accepted to ACM International Conference on Multimedia (ACM MM) 2024