基于分段合成提示和门控对齐的多标签图像识别 SSPA 框架
计算机视觉与模式识别
2024-07-31 v1
摘要
多标签图像识别是计算机视觉中的基础任务。最近,视觉-语言模型 (VLM) 在该领域取得了显著进展。然而,现有方法未能有效利用语言模型中的丰富知识,常将标签语义单向地融入视觉特征中。为克服这些问题,我们提出了基于 Split-and-Synthesize Prompting 与 Gated Alignments 的 SSPA 框架,以放大 VLM 的潜能。具体而言,我们发展了一种基于 in-context 学习的方法,关联来自大语言模型 (LLM) 的内在知识。随后,我们提出一种新的 Split-and-Synthesize Prompting (SSP) 策略,先单独建模通用知识和下游标签语义,再通过四元网络小心地聚合。此外,我们提出 Gated Dual-Modal Alignments (GDMA),实现视觉与语言模态的双向互动,消除冗余的跨模态信息,从而实现更高效的区域级对齐。与以往作品不同,我们提出一种软性聚合器,综合考虑所有图像区域的结果。借助灵活的提示和门控对齐,SSPA 可通用于特定领域。在来自三个领域 (即自然图像、行人属性和遥感图像) 的九个数据集上进行的大量实验表明,SSPA 在多标签图像识别方面实现了最先进的性能。进一步的分析验证了 SSP 和 GDMA 的有效性及可解释性。该代码将公开发布。
引用
@article{arxiv.2407.20920,
title = {SSPA: Split-and-Synthesize Prompting with Gated Alignments for Multi-Label Image Recognition},
author = {Hao Tan and Zichang Tan and Jun Li and Jun Wan and Zhen Lei and Stan Z. Li},
journal= {arXiv preprint arXiv:2407.20920},
year = {2024}
}
备注
13 pages, 8 figures