中文

ShapeSpeak:面向可见-红外行人重识别的身体形状感知文本对齐

计算机视觉与模式识别 2025-04-28 v1

摘要

可见-红外行人重识别(VIReID)旨在匹配可见与红外图像中的行人,但由于模态差异和身份特征的复杂性,仍面临挑战。现有方法仅依赖身份标签监督,难以充分提取高层次语义信息。最近出现的视觉-语言预训练模型引入了文本描述生成,增强了语义建模,但未显式建模对跨模态匹配至关重要的身体形状特征。为此,本文提出一种有效的身体形状感知文本对齐(BSaTa)框架,显式建模并利用身体形状信息以提升 VIReID 性能。具体而言,我们设计了身体形状文本对齐(BSTA)模块,通过人体解析模型提取身体形状信息,并通过 CLIP 将其转换为结构化文本表示。我们还设计了文本-视觉一致性正则化(TVCR)以确保身体形状文本表示与视觉身体形状特征的对齐。进一步,我们引入面向形状感知的表征学习(SRL)机制,结合多文本监督与分布一致性约束,引导视觉编码器学习模态无关且具辨识力的身份特征,从而提升模态不变性。实验结果表明,我们的方法在 SYSU-MM01 和 RegDB 数据集上实现了优异性能,验证了其有效性。

关键词

引用

@article{arxiv.2504.18025,
  title  = {ShapeSpeak: Body Shape-Aware Textual Alignment for Visible-Infrared Person Re-Identification},
  author = {Shuanglin Yan and Neng Dong and Shuang Li and Rui Yan and Hao Tang and Jing Qin},
  journal= {arXiv preprint arXiv:2504.18025},
  year   = {2025}
}