中文

SCING:通过选择性跨模态提示调谐实现更高效和更稳健的人再识别

计算机视觉与模式识别 2025-07-02 v1

摘要

最近的研究在将基于 CLIP 的视觉语言预训练模型适用于人员再识别(ReID)任务时,往往依赖复杂的适配器设计或模态特定调谐,同时忽视跨模态交互,导致高计算成本或次优对齐。为克服这些限制,我们提出一种简单而有效的框架,称为选择性跨模态提示调谐(SCING),通过增强跨模态对齐和对真实扰动的鲁棒性。我们的方法引入了两个关键创新:首先,我们提出了选择性视觉提示融合(SVIP),一个轻量级模块,通过跨模态门控机制动态将判别性视觉特征注入文本提示。此外,提出的扰动驱动一致性对齐(PDCA)是一种双路径训练策略,通过正规化原始和增强跨模态嵌入之间的一致性来强制在随机图像扰动下保持不变的特征对齐。对 Market1501、DukeMTMC-ReID、Occluded-Duke、Occluded-REID 和 P-DukeMTMC 等多个流行基准进行大量实验,证明了所提方法的卓越性能。值得注意的是,我们的框架在消除重型适配器的同时保持高效推理,实现了性能和计算开销之间的最佳权衡。代码将在接受后发布。

关键词

引用

@article{arxiv.2507.00506,
  title  = {SCING:Towards More Efficient and Robust Person Re-Identification through Selective Cross-modal Prompt Tuning},
  author = {Yunfei Xie and Yuxuan Cheng and Juncheng Wu and Haoyu Zhang and Yuyin Zhou and Shoudong Han},
  journal= {arXiv preprint arXiv:2507.00506},
  year   = {2025}
}