中文

MLLMReID:基于多模态大语言模型的人员重识别

计算机视觉与模式识别 2024-06-11 v3 人工智能 计算与语言

摘要

多模态大语言模型(MLLM)在许多任务中取得了令人满意的结果。然而,迄今为止,它们在人员重识别(ReID)任务中的性能尚未被探索。本文将研究如何使它们适应 ReID 任务。一个直观的想法是使用 ReID 图像-文本数据集对 MLLM 进行微调,然后将其视觉编码器作为 ReID 的骨干网络。然而,这仍然存在两个明显的问题:(1) 为 ReID 设计指令时,MLLMs 可能会过拟合特定指令,而设计多种指令会导致更高的成本。(2) 在微调 MLLM 的视觉编码器时,其并未与 ReID 任务同步训练。因此,视觉编码器微调的有效性无法直接反映在 ReID 任务的性能中。为了解决这些问题,本文提出了 MLLMReID:基于多模态大语言模型的 ReID。首先,我们提出了通用指令,这是一种利用 LLMs 续写本质能力的简单方法,避免了复杂多样的指令设计。其次,我们提出了一种基于多任务学习的同步模块,以确保 MLLM 的视觉编码器与 ReID 任务同步训练。实验结果证明了我们方法的优越性。

关键词

引用

@article{arxiv.2401.13201,
  title  = {MLLMReID: Multimodal Large Language Model-based Person Re-identification},
  author = {Shan Yang and Yongfei Zhang},
  journal= {arXiv preprint arXiv:2401.13201},
  year   = {2024}
}