中文

面向可见-红外行人重识别的嵌入与显式语义丰富化

计算机视觉与模式识别 2024-12-12 v1

摘要

可见-红外行人重识别(VIReID)旨在检索跨不同模态的相同身份行人图像。现有方法仅从图像中学习视觉内容,缺乏感知高层语义的能力。本文提出一种嵌入与丰富显式语义(Embedding and Enriching Explicit Semantics,EEES)框架,用于学习语义丰富的跨模态行人表征。本方法包含多个贡献:首先,借助多个大型语言-视觉模型,我们开发了显式语义嵌入(Explicit Semantics Embedding,ESE),自动为行人补充语言描述,并将图像-文本对对齐至共同空间,从而学习与显式语义相关的视觉内容。其次,认识到多视角信息的互补性,我们提出了跨视角语义补偿(Cross-View Semantics Compensation,CVSC),构建多视角图像-文本对表征,建立其多对多匹配,并将知识传递至单视角表征,从而用缺失的跨视角语义补偿视觉内容。再次,为消除诸如不同模态中冲突颜色属性等噪声语义,我们设计了跨模态语义净化(Cross-Modality Semantics Purification,CMSP),约束跨模态图像-文本对表征之间的距离接近于同一模态内的表征距离,从而进一步增强视觉内容的模态不变性。最终,实验结果表明,所提出的EEES方法有效且优越。

关键词

引用

@article{arxiv.2412.08406,
  title  = {Embedding and Enriching Explicit Semantics for Visible-Infrared Person Re-Identification},
  author = {Neng Dong and Shuanglin Yan and Liyan Zhang and Jinhui Tang},
  journal= {arXiv preprint arXiv:2412.08406},
  year   = {2024}
}