中文

分而治之:面向行人搜索的混合预训练

计算机视觉与模式识别 2023-12-14 v1

摘要

大规模预训练已被证明是提升不同任务性能的有效方法。当前的行人搜索方法使用ImageNet预训练模型进行特征提取,但由于预训练任务与行人搜索任务(作为下游任务)之间存在差距,这并非最优解决方案。因此,在本文中,我们专注于行人搜索的预训练,该任务涉及同时检测和重新识别个体。尽管行人搜索的标注数据稀缺,但其两个子任务——行人检测和行人重识别——的数据集相对丰富。为此,我们提出了一种专门为行人搜索设计的混合预训练框架,仅使用子任务数据。它包含一个处理具有不同类型监督数据的混合学习范式,以及一个在有限资源下缓解领域差异的跨任务对齐模块。据我们所知,这是首个研究如何利用子任务数据支持全任务预训练的工作。大量实验表明,我们预训练的模型可以在多种协议下(如行人搜索方法、微调数据、预训练数据和模型骨干网络)取得显著改进。例如,我们的模型使基于ResNet50的NAE在mAP上相对提升了10.3%。我们的代码和预训练模型已发布,供行人搜索社区即插即用。

关键词

引用

@article{arxiv.2312.07970,
  title  = {Divide and Conquer: Hybrid Pre-training for Person Search},
  author = {Yanling Tian and Di Chen and Yunan Liu and Jian Yang and Shanshan Zhang},
  journal= {arXiv preprint arXiv:2312.07970},
  year   = {2023}
}

备注

accepted by AAAI24