中文

超越视觉线索:语义驱动的令牌过滤与专家路由用于即时行人重识别

计算机视觉与模式识别 2026-04-17 v1

摘要

即时行人重识别(AT-ReID)需要在涵盖日间与夜间等不同模态以及从短期到长期的广泛服装变化场景的任意条件下,实现对目标个体的稳健检索。然而,现有方法高度依赖纯视觉特征,而这些特征会因环境和时间因素而发生变化,在涉及由照明引起的模态转换或服装变化的场景中导致显著的性能下降。本文提出语义驱动令牌过滤与专家路由(STFER),一种新型框架,利用大型视觉语言模型(LVLMs)生成身份一致性文本,从而提供对服装变化和RGB与IR之间跨模态转换具有鲁棒性的身份判别特征。具体而言,我们利用指令引导LVLMs生成捕获生物识别常数的身份内在语义文本。该文本标记进一步用于语义驱动视觉令牌过滤(SVTF),以增强信息丰富的视觉区域并抑制冗余背景噪声。同时,该文本标记也用于语义驱动专家路由(SER),将语义文本整合到专家路由中,实现更稳健的多场景门控。在Any-Time ReID数据集(AT-USTC)上的大量实验表明,我们的方法取得了最先进的成绩。此外,在5个广泛使用的ReID基准数据集上对在AT-USTC上训练的模型进行评估,显示其具备卓越的泛化能力并取得高度具竞争力的成绩。我们的代码将很快公开。

关键词

引用

@article{arxiv.2604.15090,
  title  = {Beyond Visual Cues: Semantic-Driven Token Filtering and Expert Routing for Anytime Person ReID},
  author = {Jiaxuan Li and Xin Wen and Zhihang Li},
  journal= {arXiv preprint arXiv:2604.15090},
  year   = {2026}
}