基于视觉语言模型的终身人员重识别中的属性解�合与强化
计算机视觉与模式识别
2026-03-23 v1
摘要
终身人员重识别 (LReID) 旨在从不同域中学习,以获得统一的人员检索模型。现有 LReID 方法通常侧重从头开始学习或基于视觉分类预训练模型,而视觉语言模型 (VLM) 在各种任务中显示出通用知识。尽管现有方法可直接适用于 VLM,但由于仅关注全局感知学习,细粒度属性知识未被充分利用,导致获取和抗遗忘能力受限。为此,我们提出一种新的 VLM 驱动的 LReID 方法,名为视觉语言属性解�合与强化 (VLADR)。我们的核心思想是显式建模普遍共享的人类属性,以提高跨域知识传递,从而有效利用历史知识来强化新知识学习并缓解遗忘。具体而言,VLADR 包括一个多粒度文本属性解�合机制,用于挖掘图像的全局和多样化局部文本属性。随后,发展了一种跨域跨模态属性强化方案,该方案引入跨模态属性对齐以引导视觉属性提取,并采用跨域属性对齐以实现细粒度知识传递。实验结果表明,我们的 VLADR 在抗遗忘能力和泛化能力方面分别超过最新方法 1.9%-2.2% 和 2.1%-2.5%。我们的源代码可在 https://github.com/zhoujiahuan1991/CVPR2026-VLADR 上获取。
引用
@article{arxiv.2603.19678,
title = {Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification},
author = {Kunlun Xu and Haotong Cheng and Jiangmeng Li and Xu Zou and Jiahuan Zhou},
journal= {arXiv preprint arXiv:2603.19678},
year = {2026}
}
备注
Accepted by CVPR 2026