面向视频行人属性识别的预训练基础模型时空旁路调优
计算机视觉与模式识别
2024-04-30 v1 人工智能
计算与语言
摘要
现有的行人属性识别(PAR)算法主要基于静态图像开发,然而在严重遮挡、运动模糊等挑战性场景下性能不可靠。本文提出利用视频帧来理解人体属性,通过高效微调预训练多模态基础模型,充分利用时序信息。具体而言,我们将基于视频的PAR形式化为视觉-语言融合问题,并采用预训练基础模型CLIP提取视觉特征。更重要的是,我们提出了一种新颖的时空旁路调优策略,以实现对预训练视觉基础模型的参数高效优化。为更好地利用语义信息,我们将需要识别的完整属性列表作为另一输入,并通过拆分、扩展和提示操作将属性词/短语转换为相应的句子。随后,利用CLIP的文本编码器对处理后的属性描述进行嵌入。平均后的视觉令牌和文本令牌被拼接并馈入一个融合Transformer进行多模态交互学习。增强后的令牌将被送入分类头进行行人属性预测。在两个大规模视频PAR数据集上的大量实验充分验证了所提框架的有效性。本文源代码可在 https://github.com/Event-AHU/OpenPAR 获取。
引用
@article{arxiv.2404.17929,
title = {Spatio-Temporal Side Tuning Pre-trained Foundation Models for Video-based Pedestrian Attribute Recognition},
author = {Xiao Wang and Qian Zhu and Jiandong Jin and Jun Zhu and Futian Wang and Bo Jiang and Yaowei Wang and Yonghong Tian},
journal= {arXiv preprint arXiv:2404.17929},
year = {2024}
}
备注
Parameter Efficient Fine-Tuning Strategy for Video-based Pedestrian Attribute Recognition