从多模态信息监督中学习可迁移的行人表征
计算机视觉与模式识别
2023-04-13 v1 人工智能
摘要
近期关于无监督行人重识别(reID)的研究表明,在未标注行人图像上预训练比在ImageNet上预训练能在下游reID任务上取得更优性能。然而,这些预训练方法专为reID设计,难以灵活适配其他行人分析任务。本文提出VAL-PAT,一种新颖的框架,利用多模态信息学习可迁移表征以增强各类行人分析任务。为训练该框架,我们引入三个学习目标,即自监督对比学习、图像-文本对比学习和多属性分类。自监督对比学习促进对行人内在属性的学习,而图像-文本对比学习引导模型关注行人的外观信息。同时,多属性分类鼓励模型识别属性以挖掘细粒度行人信息。我们首先在LUPerson-TA数据集上预训练,其中每张图像包含文本与属性标注,然后将学到的表征迁移至多种下游任务,包括行人重识别、行人属性识别和基于文本的行人检索。大量实验表明,我们的框架促进了通用行人表征的学习,从而在各类行人分析任务上取得有前景的结果。
引用
@article{arxiv.2304.05554,
title = {Learning Transferable Pedestrian Representation from Multimodal Information Supervision},
author = {Liping Bao and Longhui Wei and Xiaoyu Qiu and Wengang Zhou and Houqiang Li and Qi Tian},
journal= {arXiv preprint arXiv:2304.05554},
year = {2023}
}