基于 CLIP 提示视觉-语言融合的行人属性识别
计算机视觉与模式识别
2024-09-04 v2 人工智能
摘要
现有的行人属性识别(PAR)算法采用预训练 CNN(例如 ResNet)作为其主干网络进行视觉特征学习,但由于未能充分利用行人图像与属性标签之间的关系,可能获得次优结果。在本文中,我们将 PAR 表述为一个视觉-语言融合问题,并充分利用行人图像与属性标签之间的关系。具体而言,首先将属性短语扩展为句子,然后采用预训练视觉-语言模型 CLIP 作为主干网络,对视觉图像和属性描述进行特征嵌入。对比学习目标在基于 CLIP 的特征空间中将视觉和语言模态很好地连接起来,且 CLIP 中使用的 Transformer 层能够捕获像素间的长程关系。随后,采用多模态 Transformer 有效融合双重特征,并使用前馈网络预测属性。为了高效优化我们的网络,我们提出了区域感知提示微调技术,仅调整极少量参数(即仅提示向量和分类头),并固定预训练 VL 模型和多模态 Transformer。与微调策略相比,我们提出的 PAR 算法仅调整 0.75% 的可学习参数。它在 PAR 的标准和零样本设置下均取得了新的 SOTA 性能,相关数据集包括 RAPv1、RAPv2、WIDER、PA100K、PETA-ZS 和 RAP-ZS。源代码和预训练模型将发布于 https://github.com/Event-AHU/OpenPAR。
引用
@article{arxiv.2312.10692,
title = {Pedestrian Attribute Recognition via CLIP based Prompt Vision-Language Fusion},
author = {Xiao Wang and Jiandong Jin and Chenglong Li and Jin Tang and Cheng Zhang and Wei Wang},
journal= {arXiv preprint arXiv:2312.10692},
year = {2024}
}
备注
Accepted by IEEE TCSVT 2024, Camera Ready Version