深层网络中人体表征的解析分析:用于人体识别
计算机视觉与模式识别
2025-02-25 v1
摘要
随着高质量训练数据的日益增多,人体长期识别算法近期涌现。我们通过分析四个在4,788个身份和9个数据库中使用190万张图像进行训练的人体识别网络的身体图像嵌入,填补关于这些模型的知识空白。通过分析多样化的体系结构(ViT、SWIN-ViT、CNN和语言驱动CNN),我们首先表明面部对人体识别算法的准确性有贡献,并且这些算法可以对面部进行一定程度的识别——尽管没有明确的人脸训练。其次,我们表明由人体识别算法生成的表征(嵌入)包含关于性别的信息,以及图像相关信息,包括视角(yaw)甚至图像来源于哪个数据集。第三,我们演示了在不进行额外训练的情况下,通过直接和有选择地操作所学习的嵌入空间,可以提高识别准确性。利用主成分分析(PCA),在消除解释大量方差维度的子空间中,身份比较的准确性始终更高。这些发现在体系结构和测试数据集之间保持惊人的一致性。这项工作代表了对在挑战性无约束数据集上训练的长期重识别网络所产生身体表征的第一次分析。
引用
@article{arxiv.2502.15934,
title = {Dissecting Human Body Representations in Deep Networks Trained for Person Identification},
author = {Thomas M Metz and Matthew Q Hill and Blake Myers and Veda Nandan Gandi and Rahul Chilakapati and Alice J O'Toole},
journal= {arXiv preprint arXiv:2502.15934},
year = {2025}
}