面向开放词汇表的多标签识别中的类别自适应跨模态语义细化与迁移
计算机视觉与模式识别
2024-12-10 v1
摘要
受CLIP泛化能力的影响,近期的视觉语言预训练(VLP)模型已展现出捕获日常图像中几乎任何视觉概念的强大能力。然而,由于开放词汇表设置中存在未见类别,现有算法难以有效捕获类别之间强大的语义关联,导致在开放词汇表多标签识别(OV-MLR)任务上表现不佳。此外,不同对象类别中判别区域数量的显著差异与当前方法使用的固定数量的补丁匹配不匹配,引入噪声视觉线索,阻碍准确捕获目标语义。为解决这些挑战,我们提出了一种 novel 的类别自适应跨模态语义细化与迁移(CSRT)框架,以类别自适应方式探索每个类别内部以及不同类别之间的语义关联。该框架由两个互补模块组成,即类别内部语义细化(ISR)模块和类别间语义迁移(IST)模块。具体而言,ISR模块利用VLP模型的跨模态知识,自适应地找到最能代表目标类别语义的局部判别区域集合。IST模块利用大语言模型的常识能力,自适应发现目标类别最相关的类别集合,构建类别自适应关联图,并将来自已知类别的语义知识迁移到未见类别。广泛的实验表明,所提出的CSRT框架超越当前最先进算法。
引用
@article{arxiv.2412.06190,
title = {Category-Adaptive Cross-Modal Semantic Refinement and Transfer for Open-Vocabulary Multi-Label Recognition},
author = {Haijing Liu and Tao Pu and Hefeng Wu and Keze Wang and Liang Lin},
journal= {arXiv preprint arXiv:2412.06190},
year = {2024}
}
备注
15 pages