中文

开放世界用户生成视频内容上的可泛化行人搜索

计算机视觉与模式识别 2023-10-17 v1

摘要

行人搜索是一项具有挑战性的任务,涉及从大量未裁剪的场景图像中检测并检索特定个体。现有的行人搜索应用大多在同一来源场景下训练和部署。然而,由于资源和人工成本的限制,为每个场景收集和标注训练样本通常十分困难。此外,由于隐私和公共安全法规,大规模域内训练数据通常对普通开发者并不合法可用。利用易获取的大规模用户生成视频内容(即 UGC 视频)训练行人搜索模型可以拟合开放世界分布,但仍受限于与监控场景的域差异带来的性能差距。在本工作中,我们探索增强行人搜索模型的域外泛化能力,并提出了一种在特征级和数据级泛化上均可泛化的框架,以促进任意场景中的下游任务。具体而言,我们专注于通过引入基于多任务原型的域特定批量归一化,以及通道级身份相关特征解相关策略,来学习检测和 ReID 的域不变表示。我们还识别并解决了开放世界训练帧中的典型噪声来源,包括不准确的边界框、身份标签的遗漏以及跨摄像头数据的缺失。我们的框架在两个具有挑战性的行人搜索基准上取得了有前景的性能,且未使用任何来自目标域的人工标注或样本。

关键词

引用

@article{arxiv.2310.10068,
  title  = {Generalizable Person Search on Open-world User-Generated Video Content},
  author = {Junjie Li and Guanshuo Wang and Yichao Yan and Fufu Yu and Qiong Jia and Jie Qin and Shouhong Ding and Xiaokang Yang},
  journal= {arXiv preprint arXiv:2310.10068},
  year   = {2023}
}