面向文本到图像行人重识别的伪文本统一预训练
计算机视觉与模式识别
2023-09-06 v1
摘要
预训练任务对于文本到图像行人重识别(T2I-ReID)任务是不可或缺的。然而,这两个任务之间存在两种潜在的不一致,可能影响性能:i) 数据不一致。公开预训练模型中使用的通用图像/文本与T2I-ReID任务中的特定行人数据之间存在较大的域鸿沟。这种鸿沟对文本尤为严重,因为通用文本数据通常无法以细粒度细节描述特定行人。ii) 训练不一致。尽管跨模态学习对T2I-ReID至关重要,图像和文本的预训练过程是独立的。为解决上述问题,我们提出了一种专为T2I-ReID任务设计的新的统一预训练流程(UniPT)。我们首先构建了一个大规模文本标注行人数据集“LUPerson-T”,其中图像的伪文本描述由CLIP范式采用分治合策略自动生成。得益于该数据集,我们随后利用一个简单的视觉与语言预训练框架,在预训练期间显式对齐图像与文本模态的特征空间。如此,预训练任务与T2I-ReID任务在数据和训练层面上彼此一致。无需任何花哨技巧,我们的UniPT在CUHK-PEDES、ICFG-PEDES和RSTPReid上分别取得了具竞争力的Rank-1准确率:68.50%、60.09%和51.85%。LUPerson-T数据集与代码均可在 https;//github.com/ZhiyinShao-H/UniPT 获取。
引用
@article{arxiv.2309.01420,
title = {Unified Pre-training with Pseudo Texts for Text-To-Image Person Re-identification},
author = {Zhiyin Shao and Xinyu Zhang and Changxing Ding and Jian Wang and Jingdong Wang},
journal= {arXiv preprint arXiv:2309.01420},
year = {2023}
}
备注
accepted by ICCV 2023