通过基于语义的预训练重新思考行人重识别
计算机视觉与模式识别
2022-12-29 v2
摘要
预训练是计算机视觉中的主导范式。通常,有监督的 ImageNet 预训练常用于初始化行人重识别(Re-ID)模型的骨干网络。然而,近期工作展示了一个令人惊讶的结果:由于在 ImageNet 与行人 Re-ID 数据间存在较大领域鸿沟,基于 CNN 的 ImageNet 预训练对 Re-ID 系统影响有限。为寻求传统预训练的替代方案,本文研究基于语义的预训练,将其作为利用额外文本数据以对抗 ImageNet 预训练的另一种方法。具体而言,我们首次针对行人 Re-ID 事件手动构建了多样化的 FineGPR-C 描述数据集。基于此,提出一种名为 VTBR 的纯语义预训练方法,采用稠密描述以更少图像学习视觉表征。我们在 FineGPR-C 数据集的描述上从头训练卷积神经网络,再将其迁移至下游 Re-ID 任务。在基准数据集上的综合实验表明,尽管使用的图像最多少 1.4 倍,我们的 VTBR 仍能与 ImageNet 预训练取得有竞争力的性能,揭示了其在 Re-ID 预训练中的潜力。
引用
@article{arxiv.2110.05074,
title = {Rethinking Person Re-Identification via Semantic-Based Pretraining},
author = {Suncheng Xiang and Jingsheng Gao and Zirui Zhang and Mengyuan Guan and Binjie Yan and Ting Liu and Dahong Qian and Yuzhuo Fu},
journal= {arXiv preprint arXiv:2110.05074},
year = {2022}
}