PS-ReID:基于多模态检索推进行人重识别与精确分割
计算机视觉与模式识别
2025-09-03 v2
摘要
行人重识别(ReID)在安防监控和刑事调查等应用中发挥着关键作用。大多数传统的基于图像的 ReID 方法面临遮挡和光照变化等挑战,而文本提供了互补信息以缓解这些问题。然而,图像与文本两种模态的融合仍有待深入探索。为填补这一空白,我们提出 {\bf PS-ReID},一种结合图像和文本输入以增强 ReID 性能的多模态模型。与受限于裁剪行人图像的现有 ReID 方法不同,我们的 PS-ReID 聚焦于全场景设定,并引入了结合分割的多模态 ReID 任务,即使在遮挡等挑战性条件下也能实现对查询个体的精确特征提取。为此,我们的模型采用双路径非对称编码方案,显式分离查询与目标角色:查询分支捕获身份判别性线索,而目标分支执行全局场景推理。此外,token 级 ReID 损失对身份感知 token 进行监督,将检索与分割耦合,从而生成在空间上精确且身份一致的掩码。为便于系统评估,我们构建了 M2ReID,这是目前最大的全场景多模态 ReID 数据集,包含超过 20 万张图像和 4,894 个身份,具备多模态查询和高质量分割掩码。实验结果表明,PS-ReID 在 ReID 和分割任务中均显著优于基于单模态查询的模型。该模型在遮挡、低光照和背景杂乱等具有挑战性的真实场景中表现出色,为行人检索与分割提供了稳健且灵活的解决方案。所有代码、模型和数据集将公开发布。
引用
@article{arxiv.2503.21595,
title = {PS-ReID: Advancing Person Re-Identification and Precise Segmentation with Multimodal Retrieval},
author = {Jincheng Yan and Yun Wang and Xiaoyan Luo and Yu-Wing Tai},
journal= {arXiv preprint arXiv:2503.21595},
year = {2025}
}