中文

最小化预训练差距:基于域对齐的文本人物检索

计算机视觉与模式识别 2026-03-31 v2

摘要

本文聚焦于文本人物检索,即基于文本描述识别个体。在合成数据预训练推动的进展下,由于光照、颜色和视角的差异导致的显著域差距,限制了预训练-微调范式的效果。为克服此问题,我们提出了一种集成图像级和区域级域适应的统一管道。本方法包含两个关键组件:Domain-aware Diffusion (DaD) 用于图像级适应,将合成域与真实世界域(如 CUHK-PEDES)的图像分布对齐;以及 Multi-granularity Relation Alignment (MRA) 用于区域级适应,将视觉区域与描述性句子对齐,从而在更细的粒度上解决差异。这种双层策略有效地弥合了域差距,在 CUHK-PEDES、ICFG-PEDES 和 RSTPReid 数据集上实现了最先进的性能。该数据集、模型和代码均已公开于 https://github.com/Shuyu-XJTU/MRA。

关键词

引用

@article{arxiv.2507.10195,
  title  = {Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval},
  author = {Shuyu Yang and Yaxiong Wang and Yongrui Li and Li Zhu and Zhedong Zheng},
  journal= {arXiv preprint arXiv:2507.10195},
  year   = {2026}
}