中文

基于梯度注意力引导的双掩码协同框架用于鲁棒文本人物检索

计算机视觉与模式识别 2025-09-12 v1

摘要

虽然Contrastive Language-Image Pre-training(CLIP)在各类视觉任务中表现出强大的性能,但其在人物表征学习中的应用面临两个关键挑战:(i) 针对人物中心图像的大规模标注视觉语言数据稀缺;(ii) 全局对比学习的内在局限性,难以保持细粒度匹配所必需的判别性局部特征,同时对噪声文本标记较为脆弱。本工作通过数据构建和模型架构的协同改进,推动CLIP在人物表征学习方面的发展。首先,我们开发了抗噪声的数据构建管道,利用大语言多模态模型(MLLMs)的上下文学习能力自动过滤和标注网络来源图像,得到WebPerson——一个包含500万组高质量人物中心图像文本对的大规模数据集。其次,我们引入GA-DMS(Gradient-Attention Guided Dual-Masking Synergetic)框架,通过梯度注意力相似度得分自适应掩码噪声文本标记。此外,我们纳入掩码标记预测目标,迫使模型预测具有信息性的文本标记,从而增强细粒度语义表征学习。大量实验表明,GA-DMS在多个基准数据集上实现了零样态性能。

关键词

引用

@article{arxiv.2509.09118,
  title  = {Gradient-Attention Guided Dual-Masking Synergetic Framework for Robust Text-based Person Retrieval},
  author = {Tianlu Zheng and Yifan Zhang and Xiang An and Ziyong Feng and Kaicheng Yang and Qichuan Ding},
  journal= {arXiv preprint arXiv:2509.09118},
  year   = {2025}
}

备注

Accepted by EMNLP2025 Main