中文

基于提示锚点的视觉-文本蒸馏用于终身行人重识别

计算机视觉与模式识别 2026-05-07 v1

摘要

终身行人重识别(LReID)旨在训练一个可泛化的模型,利用依次收集的数据。然而,这类模型常因语义漂移、适应性受限以及在新域出现时遭遇灾难性遗忘而受到影响。现有无样本方法主要依赖视觉单模态蒸馏或参数正则化,却忽视了如文本等辅助模态在维持语义稳定性和实现增量塑性方面的潜力。我们观察到,预训练视觉-语言模型中冻结的文本编码器可作为跨域稳定语义锚点。为解耦视觉与文本的角色,我们提出了基于提示锚点的视觉-文本蒸馏(PAD),这是一种用于语义对齐和跨域泛化的非对称视觉-文本框架。在文本侧,我们通过蒸馏提示来保持视觉-文本对齐,维持固定语义空间下的对齐,充当全局语义参考,而非主导学习信号。在视觉侧,采用基于指数移动平均(EMA)的教师模型,配合自适应提示池,通过分配新槽位而冻结过去槽位,实现域相关适应。大量实验表明,PAD 在看到和未看到的域上均显著优于最先进的方法,在稳定性与塑性之间实现了强大平衡。项目页面已提供:https://github.com/zu-zi/PAD。

关键词

引用

@article{arxiv.2605.05027,
  title  = {Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification},
  author = {Wen Wen and Hao Chen and Shiliang Zhang},
  journal= {arXiv preprint arXiv:2605.05027},
  year   = {2026}
}

备注

Accepted to CVPR 2026