中文

大型视觉语言模型如何应用于人类重识别

计算机视觉与模式识别 2026-05-12 v2

摘要

大型视觉语言模型 (LVLMs) 通过融合视觉模型和大型语言模型,已在跨模态理解和推理任务中取得显著成果。近年来,人类重识别 (ReID) 也开始探索跨模态语义以提高身份识别准确率。然而,有效地将 LVLMs 应用于 ReID 仍是一个开放的挑战。虽然 LVLMs 在生成式范式下通过预测下一个输出单词来工作,但 ReID 需要提取判别性身份特征以跨摄像头匹配行人。在本文中,我们提出了 LVLM-ReID,一种新型框架,旨在发挥 LVLMs 的优势来促进 ReID。具体而言,我们利用指令引导 LVLMs 生成一个语义标记,封装来自人物图像的关键外观语义。该标记经我们设计的语义引导交互 (SGI) 模块进一步优化,通过语义标记和视觉标记之间的相互作用实现。最终,强化后的语义标记作为行人身份的表示。我们的框架将 LVLMs 的语义理解和生成能力集成到端到端 ReID 训练中,使 LVLMs 能够在训练和推理期间捕获丰富的语义线索。LVLM-ReID 在多个基准数据集上实现了具竞争力的成绩,无需额外的图像-文本标注,展示了 LVLMs 生成的语义对推动人类 ReID 的潜力。

关键词

引用

@article{arxiv.2411.18111,
  title  = {When Large Vision-Language Models Meet Person Re-Identification},
  author = {Qizao Wang and Bin Li and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2411.18111},
  year   = {2026}
}

备注

Accepted by ICASSP 2026