中文

基于双向调制的场景自适应行人搜索

计算机视觉与模式识别 2024-05-07 v1

摘要

行人搜索旨在从包含多种场景的图库图像集中定位特定目标人物。随着行人场景的变化,捕获的人像图像不可避免地引入大量与人物身份无关的背景噪声和前景噪声,导致严重的性能退化。为解决此问题,本文提出一种场景自适应行人搜索(SEAS)模型,通过引入双向调制机制同时消除场景噪声并保持一致的人体表征以适应不同场景。在SEAS中,设计了背景调制网络(BMN),将从检测框提取的特征编码为多尺度嵌入,通过范数感知方式在多个层次上减少背景噪声的输入。此外,为缓解前景噪声对人体特征的影响,SEAS引入前景调制网络(FMN),基于场景图像的特征图计算人体嵌入的杂击加减。通过对背景和前景进行双向调制,SEAS在端到端 manner下获得了无场景噪声的一致特征表征。在两个基准数据集上实现了最先进(SOTA)性能,CUHK-SYSU达到97.1% mAP,PRW达到60.5% mAP。代码已公开:https://github.com/whbdmu/SEAS。

关键词

引用

@article{arxiv.2405.02834,
  title  = {Scene-Adaptive Person Search via Bilateral Modulations},
  author = {Yimin Jiang and Huibing Wang and Jinjia Peng and Xianping Fu and Yang Wang},
  journal= {arXiv preprint arXiv:2405.02834},
  year   = {2024}
}