探索用于行人重识别的部件感知视觉-语言学习
计算机视觉与模式识别
2025-03-24 v2
摘要
近来,视觉-语言学习(VLL)在增强基于视觉的行人重识别(ReID)方面展现出巨大潜力。现有基于 VLL 的 ReID 方法通常关注整体身体层面的图像-文本特征对齐,而忽略了对细粒度部件特征的监督,因而缺乏局部特征语义一致性的约束。为此,我们提出部件感知视觉-语言学习(-VL),利用部件感知的语言监督增强细粒度视觉特征以用于 ReID 任务。具体而言,-VL 引入了人体解析引导的提示调优策略和分层视觉-语言对齐范式,以确保部件内特征语义一致性。前者结合身份标签与人体解析图构成像素级文本提示,后者将多尺度视觉特征与轻量辅助头融合以执行细粒度图像-文本对齐。作为一种即插即用且无推理开销的方案,我们的 -VL 在四个常用 ReID 基准上取得了与最先进方法相当或更优的性能。值得注意的是,在具有挑战性的 MSMT17 数据库上,它取得了 91.0% 的 Rank-1 和 76.9% 的 mAP,且无额外修饰。
引用
@article{arxiv.2308.02738,
title = {Exploring Part-Informed Visual-Language Learning for Person Re-Identification},
author = {Yin Lin and Yehansen Chen and Baocai Yin and Jinshui Hu and Bing Yin and Cong Liu and Zengfu Wang},
journal= {arXiv preprint arXiv:2308.02738},
year = {2025}
}
备注
6 pages, 4 figures, ICME 2025