ALADIN:基于属性语言蒸馏的人员重识别网络
计算机视觉与模式识别
2026-04-01 v2
摘要
最近的视觉语言模型如 CLIP 提供了强大的跨模态对齐能力,但当前的 CLIP 指导下的 ReID 流程依赖全局特征和固定提示,限制了其捕捉细粒度属性线索和适应多样化外观的能力。我们提出 ALADIN,一种属性语言蒸馏网络,从冻结的 CLIP 教师蒸馏知识到轻量级 ReID 学生。ALADIN 引入细粒度属性局部对齐以建立自适应文本-视觉对应关系和稳健的表征学习。场景感知提示生成器产生图像特定的软提示以促进自适应对齐。属性局部蒸馏强制文本属性与局部视觉特征保持一致,显著提升遮挡情况下的鲁棒性。此外,我们采用跨模态对比和关系蒸馏以保留属性之间的内在结构关系。为提供精确的监督,我们利用多模态 LLM 生成结构化属性描述,再通过 CLIP 转换为局部注意力图。在推理阶段,仅使用学生模型。在 Market-1501、DukeMTMC-reID 和 MSMT17 数据集上的实验表明,我们的 method 超越 CNN、Transformer 和 CLIP 基于的方法,具有更好的泛化能力和可解释性。
引用
@article{arxiv.2603.21482,
title = {ALADIN:Attribute-Language Distillation Network for Person Re-Identification},
author = {Wang Zhou and Boran Duan and Haojun Ai and Ruiqi Lan and Ziyue Zhou},
journal= {arXiv preprint arXiv:2603.21482},
year = {2026}
}
备注
14pages, 3figures, 7charts