恢复并匹配:通过知识约束最优运输实现开放词汇多标签识别
计算机视觉与模式识别
2025-03-20 v1
摘要
在图像中识别多个新类,称为开放词汇多标签识别,是计算机视觉中的一个具有挑战性的任务。最近的研究探索将强大的视觉语言模型如 CLIP 进行迁移。然而,这些方法面临两个关键挑战:(1) 由于全局预训练目标,CLIP 的局部语义被破坏,导致区域预测不可靠。(2) 图像区域与候选标签之间的匹配属性被忽视,依赖于平均池化等简单的特征聚合,从而导致来自无关区域的虚假预测。本文提出了 RAM (Recover And Match),一个新型框架有效解决上述问题。为解决第一个问题,我们提出梯子局部适配器 (LLA) 来强制聚焦局部区域,以一种内存友好的方式恢复局部语义。对于第二个问题,我们提出知识约束最优运输 (KCOT) 通过将任务形式化为最优运输问题来抑制对非 GT 标签的无意匹配。结果,RAM 在来自三个不同领域的 various 数据集上实现了最佳性能,并显示出巨大潜力来提升现有方法。代码: https://github.com/EricTan7/RAM
引用
@article{arxiv.2503.15337,
title = {Recover and Match: Open-Vocabulary Multi-Label Recognition through Knowledge-Constrained Optimal Transport},
author = {Hao Tan and Zichang Tan and Jun Li and Ajian Liu and Jun Wan and Zhen Lei},
journal= {arXiv preprint arXiv:2503.15337},
year = {2025}
}
备注
CVPR 2025