中文

LLaVA-ReID:用于交互式人物重识别的选择性多图像问答模型

计算机视觉与模式识别 2025-05-27 v3

摘要

传统的基于文本的人物重识别假设目击者的人物描述是完整且一次性提供的。然而在实际场景中,这些描述往往是部分或模糊的。为解决这一局限性,我们提出了一种新任务——交互式人物重识别(Inter-ReID)。Inter-ReID 是一种基于对话的检索任务,通过与目击者持续互动来迭代细化初始描述。为促进这一新任务的研究,我们构建了一个包含多种问题类型的对话数据集,通过细化属性分解来实现。我们进一步提出了 LLaVA-ReID,一种基于视觉和文本语境生成针对性问题的问答模型,以从目标人物处获取更多细节。借助一种“前瞻”策略,我们在训练过程中优先选择最具信息性的问题作为监督。在 Inter-ReID 和基于文本的重识别基准测试上进行的实验结果表明,LLaVA-ReID 显著优于基线方法。

关键词

引用

@article{arxiv.2504.10174,
  title  = {LLaVA-ReID: Selective Multi-image Questioner for Interactive Person Re-Identification},
  author = {Yiding Lu and Mouxing Yang and Dezhong Peng and Peng Hu and Yijie Lin and Xi Peng},
  journal= {arXiv preprint arXiv:2504.10174},
  year   = {2025}
}

备注

Accepted by ICML 2025