中文

基于交叉模态自适应元学习的文本驱动人员检索 CAMeL

计算机视觉与模式识别 2025-04-29 v1 多媒体

摘要

文本驱动人员检索旨在使用文本描述在图像数据库中识别特定个体。由于标注成本高昂和隐私保护需求,研究者常采用合成数据进行预训练和微调。然而,这些生成数据在图像和文本标注方面常常存在域偏差,显著削弱了预训练模型的可扩展性。因此,我们引入基于交叉模态自适应元学习 (CAMeL) 的域无关预训练框架,以增强模型在预训练阶段的泛化能力,以便更好地支持后续下游任务。具体而言,我们开发了一系列反映真实场景多样性和复杂性的任务,并引入动态错误样本记忆单元以记忆多个任务中遇到的错误。为进一步确保多任务适应,我们还采用自适应双速率更新策略,平衡对新任务的快速适应和对历史任务的慢速权重更新。尽管方法简单,我们提出的模型不仅在包括 CUHK-PEDES、ICFG-PEDES 和 RSTPReid 在内的真实世界基准数据集上超越了现有最先进的方法,还在处理偏置合成图像和噪声文本标注方面表现出良好的鲁棒性和可扩展性。我们的代码已公开于 https://github.com/Jahawn-Wen/CAMeL-reID。

关键词

引用

@article{arxiv.2504.18782,
  title  = {CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval},
  author = {Hang Yu and Jiahao Wen and Zhedong Zheng},
  journal= {arXiv preprint arXiv:2504.18782},
  year   = {2025}
}