通过交错多域身份课程在统一空间中实现人脸、全身与物体分类
计算机视觉与模式识别
2025-11-26 v1
摘要
视觉基础模型可以在零样本模式下执行通用物体分类,而在进行微调后可进行人脸/人识别。然而,微调后的模型会遭受灾难性遗忘。我们创建了能够在单个嵌入空间中执行四项任务(物体识别、来自高质量和低质量图像的人脸识别、从全身图像中进行人识别)的模型,而不会出现显著的灾难性遗忘。为此,我们提出了两种交错多域身份课程(IMIC)变体:一种针对所有四项任务的梯度耦合、交错训练计划的细化模型。IMIC 方法在三种基础模型(DINOv3、CLIP 和 EVA-02)上均证明有效。其中两种(EVA-02 和 CLIP)在所有四项任务上与领域专家相当,同时在跨人脸、身体和物体数据集的多任务方面比人类更准确。进一步,我们演示了我们的方法在不显著损害外分布 generalization 的情况下仍能保持基础模型的关键属性。对最准确的模型变体(EVA-02 + IMIC A 和 B)进行分析,显示四项任务在统一嵌入空间中呈线性可分表示,但在任务之间存在大量特征共享。来自任何一个任务的不足 100 个主成分即可在几乎零性能降解的情况下完成所有其他任务。
引用
@article{arxiv.2511.19846,
title = {Face, Whole-Person, and Object Classification in a Unified Space Via The Interleaved Multi-Domain Identity Curriculum},
author = {Thomas M Metz and Matthew Q Hill and Alice J O'Toole},
journal= {arXiv preprint arXiv:2511.19846},
year = {2025}
}