SequencePAR:通过序列生成范式理解行人属性
计算机视觉与模式识别
2025-09-03 v2 多媒体
摘要
当前的行人属性识别(PAR)算法使用多标签或多任务学习框架以及特定的分类头。这些模型通常难以处理不平衡数据和噪声样本。受生成模型成功的启发,我们提出了序列行人属性识别(SequencePAR),一种用于PAR的新型序列生成范式。SequencePAR使用语言-图像预训练模型提取行人特征,并将属性集嵌入到由文本提示引导的查询令牌中。Transformer解码器通过整合视觉特征和属性查询令牌来生成行人属性。解码器中的掩码多头注意力层在训练期间阻止模型预测下一个属性。在多个PAR数据集上的大量实验验证了SequencePAR的有效性。具体而言,在PETA数据集上,我们在准确率、精确率、召回率和F1分数上分别达到了84.92%、90.44%、90.73%和90.46%。源代码和预训练模型可在https://github.com/Event-AHU/OpenPAR获取。
引用
@article{arxiv.2312.01640,
title = {SequencePAR: Understanding Pedestrian Attributes via A Sequence Generation Paradigm},
author = {Jiandong Jin and Xiao Wang and Yin Lin and Chenglong Li and Lili Huang and Aihua Zheng and Jin Tang},
journal= {arXiv preprint arXiv:2312.01640},
year = {2025}
}
备注
Accepted by Pattern Recognition 2025