学习语言驱动的序列级模态不变表示用于视频基可见光-红外行人重识别
计算机视觉与模式识别
2026-01-21 v1
摘要
视频基可见光-红外行人重识别(VVI-ReID)的核心在于学习跨不同模态的序列级模态不变表示。近期研究倾向于使用由 CLIP 生成的模态共享语言提示来指导模态不变表示的学习。尽管取得了最优性能,此类方法在高效的时空建模、充分的跨模态交互以及显式的模态级损失指导方面仍面临局限。为解决这些问题,我们提出了语言驱动的序列级模态不变表示学习(LSMRL)方法,该方法包含时空特征学习(STFL)模块、语义扩散(SD)模块和跨模态交互(CMI)模块。为了实现参数和计算高效的时空建模,STFL 模块基于 CLIP 构建,并做了最小化修改。为了实现充分的跨模态交互并增强模态不变特征的学习,我们提出了 SD 模块,将模态共享的语言提示扩散到可见光和红外特征中,以建立初步的模态一致性。进一步开发了 CMI 模块,利用双向跨模态自注意力来消除残余的模态差异并细化模态不变表示。为了显式增强模态不变表示的学习,引入了两个模态级损失,以提高特征的判别能力及其对未见类别的泛化能力。在大规模 VVI-ReID 数据集上的大量实验证明了 LSDRM 方法相对于当前最优方法的优越性。
引用
@article{arxiv.2601.12062,
title = {Learning Language-Driven Sequence-Level Modal-Invariant Representations for Video-Based Visible-Infrared Person Re-Identification},
author = {Xiaomei Yang and Xizhan Gao and Antai Liu and Kang Wei and Fa Zhu and Guang Feng and Xiaofeng Qu and Sijie Niu},
journal= {arXiv preprint arXiv:2601.12062},
year = {2026}
}