TeD-Loc:用于弱监督目标局部化的文本蒸馏
计算机视觉与模式识别
2026-05-01 v2 机器学习
摘要
弱监督目标局部化(WSOL)模型仅使用图像级别的类别标签进行训练。它们可以预测目标类别以及对应于目标的空间区域,而无需明确的边界框注释。鉴于其对分类目标的依赖,传统的WSOL方法,如类激活映射,倾向于聚焦于最具辨识力的目标区域,往往忽略整个空间范围。虽然视觉语言模型如CLIP编码了丰富的语义先验,但它们不直接适用于WSOL,因为全局文本和类别标记嵌入与局部 patch 嵌入未明确对齐,使得在没有额外机制的情况下进行 patch 级别的局部化具有挑战性。最近的方法如GenPrompt解决了这一限制,但以增加复杂性为代价,它们依赖条件去噪和复杂的提示学习策略。我们提出一种用于局部化的文本蒸馏(TeD-Loc),通过对比对齐将 CLIP 文本嵌入传递到 patch 嵌入中,从而实现 patch 级别的前景/背景局部化。还引入了一个以局部化得分来聚合前景 patch 嵌入以实现联合分类和局部化的局部化引导分类模块。此外,应用基于 QR 分解的类别文本嵌入正交化,以提高对语义相似类别的辨识。广泛的实验表明,TeD-Loc 在 CUB 和 ILSVRC 上的 Top-1 Loc 提升约 5%,在组织病理学基准测试中的 PxAP 提升约 31%,同时比 GenPrompt 实现更高效。
引用
@article{arxiv.2501.12632,
title = {TeD-Loc: Text Distillation for Weakly Supervised Object Localization},
author = {Shakeeb Murtaza and Soufiane Belharbi and Alexis Guichemerre and Marco Pedersoli and Eric Granger},
journal= {arXiv preprint arXiv:2501.12632},
year = {2026}
}