中文

并非所有初始点都相等:预训练先验及其在人体识别中的显著影响

计算机视觉与模式识别 2026-05-22 v3

摘要

近年来,计算机视觉领域出现了多样化的通用预训练方法的爆发式发展。然而,这些预训练方法对人体识别任务(re-id)的影响仍未得到充分探讨。我们展示在等价域适应流程下,使用不同初始模型(网络结构和预训练权重)进行人体识别会产生显著的差异。我们指出,针对各种 re-id 测试的不同下游性能差异的直觉解释均不充分,並提出预训练权重作为域适应期间学习权重的强先验。该框架下,域适应解可视为戈布斯后验的最大概率点估计,其中预训练权重充当先验。基于此框架,我们展示大型预训练基础模型通过简单域适应即可在多个 re-id 数据集(Market, PRCC, DeepChange, BTS)上实现 SOTA 解,其中解的参数空间与初始参数非常接近。此外,我们对这些解进行消除实验,表明它们可通过小型迁移集合和不同迁移数据集达成,但对优化器、权重衰减和损失函数的选择较为敏感。最终,我们提议,使用大型视觉基础模型(CLIP、Dino、EVA、AIM 等)进行直接微调的简单方法应作为未来人体识别工作的重要基线。

关键词

引用

@article{arxiv.2507.17640,
  title  = {Not All Starting Points Are Equal: Pre-trained Priors and Their Outsized Impact on Person Identification},
  author = {Thomas M. Metz and Matthew Q. Hill and Alice J. O'Toole},
  journal= {arXiv preprint arXiv:2507.17640},
  year   = {2026}
}