中文

基于 MLLM 以人为本交互学习的文本到图像行人重识别

机器学习 2025-06-16 v1 多媒体

摘要

尽管跨模态嵌入模型的突破促进了文本到图像行人重识别 的发展,但由于网络架构和数据质量等内在限制,现有方法通常难以区分具有挑战性的候选图像。为了解决这些问题,我们提出了一种交互式跨模态学习框架,该框架利用以人为本的交互,通过外部多模态知识增强文本查询的判别力。为此,我们提出了一种即插即用的测试时以人为本交互 模块,该模块执行关注人类特征的视觉问答,促进与多模态大语言模型 (MLLM) 的多轮交互,以使查询意图与潜在目标图像对齐。具体而言,THI 根据 MLLM 的响应用户查询进行细化,以缩小与最佳匹配图像的差距,从而提升排序准确率。此外,为了解决低质量训练文本的限制,我们引入了一种基于信息丰富和多样性增强的新型重组数据增强 策略,通过丰富、分解和重组行人描述来增强查询判别力。在四个 TIReID 基准(即 CUHK-PEDES、ICFG-PEDES、RSTPReid 和 UFine6926)上的大量实验表明,我们的方法取得了显著的性能和大幅提升。

关键词

引用

@article{arxiv.2506.11036,
  title  = {Human-centered Interactive Learning via MLLMs for Text-to-Image Person Re-identification},
  author = {Yang Qin and Chao Chen and Zhihang Fu and Dezhong Peng and Xi Peng and Peng Hu},
  journal= {arXiv preprint arXiv:2506.11036},
  year   = {2025}
}