中文

SA-Person: 基于场景感知重排序的文本行人检索

计算机视觉与模式识别 2025-11-25 v3

摘要

基于文本的行人检索旨在利用自然语言描述从图像库中识别目标个体。现有方法主要侧重于外观驱动的跨模态检索,但由于场景的视觉复杂性和文本描述固有的模糊性,面临重大挑战。地标和关系线索等上下文信息提供了互补线索,可为检索提供有价值的补充见解,但在当前方法中仍未被充分利用。受此局限性启发,我们提出了一种新范式:场景感知的基于文本的行人检索,其显式整合了个体外观和全局场景上下文以提高检索准确率。为此,我们首先引入了ScenePerson-13W,这是一个大规模基准数据集,包含超过100,000个真实世界场景,具有涵盖行人属性和场景上下文的丰富标注。基于该数据集,我们进一步提出了SA-Person,一个两阶段检索框架。在第一阶段,SA-Person通过将文本描述与行人特定区域对齐来执行判别性外观定位。在第二阶段,它引入了SceneRanker,一个无需训练的场景感知重排序模块,通过联合推理行人外观和全局场景上下文来优化检索结果。在ScenePerson-13W和现有基准上的大量实验证明了我们提出的SA-Person的有效性。数据集和代码将公开发布以促进未来研究。

关键词

引用

@article{arxiv.2505.24466,
  title  = {SA-Person: Text-Based Person Retrieval with Scene-aware Re-ranking},
  author = {Yingjia Xu and Jinlin Wu and Daming Gao and Zhen Chen and Yang Yang and Min Cao and Mang Ye and Zhen Lei},
  journal= {arXiv preprint arXiv:2505.24466},
  year   = {2025}
}

备注

13 pages, 8 figures. Under review