DMPT:面向多模态目标重识别的解耦模态感知提示调优
计算机视觉与模式识别
2025-04-16 v1
摘要
当前基于大规模预训练主干网络(如 ViT)的多模态目标重识别方法取得了显著进展,成绩优异。然而,这些方法通常采用标准的全参数微调范式,需要优化大量主干参数,导致计算和存储需求大。为此,本文提出一种高效的提示调优框架,专为多模态目标重识别设计,称为 DMPT,该框架冻结主干网络,仅优化 newly added 的解耦模态感知参数。具体而言,我们显式地将视觉提示解耦为模态特定提示,这些提示利用来自强大文本编码器的先验模态知识,以及模态无关的语义提示,这些提示从多模态输入(如可见光、近红外和热红外)中提取语义信息。在提取的特征基础上,我们进一步设计了一种 Prompt Inverse Bind(PromptIBind)策略,利用绑定提示作为不同模态语义提示标记之间的媒介,以促进不同模态信息的互补交流,提升最终的重识别效果。在多个常见基准测试上,我们的实验结果表明,DMPT 能在仅使用 6.5% 的主干参数微调的情况下,达到与现有最先进方法相当的性能。
引用
@article{arxiv.2504.10985,
title = {DMPT: Decoupled Modality-aware Prompt Tuning for Multi-modal Object Re-identification},
author = {Minghui Lin and Shu Wang and Xiang Wang and Jianhua Tang and Longbin Fu and Zhengrong Zuo and Nong Sang},
journal= {arXiv preprint arXiv:2504.10985},
year = {2025}
}
备注
2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)