CLIP-DFGS:面向通用人体重识别的 CLIP 硬样本挖掘方法
计算机视觉与模式识别
2024-10-16 v1
摘要
近期针对CLIP等预训练视觉语言模型的进展在人体重识别(ReID)应用中显示出前景,但其在通用人体重识别任务中的性能仍不理想。CLIP预训练所使用的大规模且多样化的图像-文本对可能导致某些细粒度特征的缺失或不足。鉴于这些挑战,我们提出一种基于深度优先搜索的硬样本挖掘方法,称为DFGS(Depth-First Graph Sampler),旨在为CLIP提供足够具挑战性的样本,以增强其提取细粒度特征的能力。DFGS可同时应用于CLIP的图像编码器和文本编码器。通过利用CLIP的强大跨模态学习能力,我们旨在应用DFGS方法提取具挑战性的样本并构建高判别难度的 mini-batch,为图像模型提供更高效且更具挑战性的难以区分的样本,从而增强其区分个体的能力。我们的结果显示,与其他方法相比,DFGS在提供提升CLIP在通用人体重识别中性能的具挑战性样本方面取得显著改进。
引用
@article{arxiv.2410.11255,
title = {CLIP-DFGS: A Hard Sample Mining Method for CLIP in Generalizable Person Re-Identification},
author = {Huazhong Zhao and Lei Qi and Xin Geng},
journal= {arXiv preprint arXiv:2410.11255},
year = {2024}
}
备注
Accepted by ACM TOMM