中文

SapiensID:面向人类识别的通用基石模型

计算机视觉与模式识别 2025-04-08 v1

摘要

现有的 human recognition 系统常依赖面孔与身体分析的独立专业模型,在姿态、可见性和情境多变的实际场景中效果受限。本文引入 SapiensID,一个统一模型,旨在弥合这一差距,实现跨多场景的稳健性能。SapiensID 引入 (i) Retina Patch (RP),一种动态 patch 生成方案,适应主体尺度,确保兴趣区域的一致化 tokenization;(ii) 掩码识别模型 (masked recognition model, MRM),学习可变 token 长度;(iii) 语义注意力头 (Semantic Attention Head, SAH),一种通过对关键身体部位特征池化来学习姿态不变表征的模块。为促进训练,我们引入 WebBody4M,一个大规模数据集,捕捉多样姿态和尺度变化。广泛实验表明,SapiensID 在各种 body ReID 数据集上实现最新成果,在短期和长期场景中均超越专用模型,同时在专注面部识别系统方面表现竞争。此外,SapiensID 为新近提出的 Cross Pose-Scale ReID 挑战树立了强大基线,展示了其在复杂实际场景中的泛化能力。

关键词

引用

@article{arxiv.2504.04708,
  title  = {SapiensID: Foundation for Human Recognition},
  author = {Minchul Kim and Dingqiang Ye and Yiyang Su and Feng Liu and Xiaoming Liu},
  journal= {arXiv preprint arXiv:2504.04708},
  year   = {2025}
}

备注

To appear in CVPR2025