中文

VLM-PAR:面向行人属性识别的视觉语言模型

计算机视觉与模式识别 2025-12-30 v1 人工智能

摘要

行人属性识别(PAR)涉及从行人图像中预测细粒度属性,如服装颜色、性别和配件,但受到严重的类别不平衡、复杂的属性依赖关系以及域迁移的限制。我们引入 VLM-PAR,一个基于冻结的 SigLIP 2 多语言编码器构建的模块化视觉语言框架。通过通过紧凑的交叉注意力融合细化视觉特征来对齐图像和提示嵌入,VLM-PAR 在高度不平衡的 PA100K 数据集上实现了显著的准确率提升,取得了新的状态突破性能,同时也在 PETA 和 Market-1501 数据集上实现了显著的平均准确率提升。这些结果凸显了将大规模视觉语言预训练与针对性的跨模态细化相结合,以克服 PAR 中的不平衡和泛化挑战的有效性。

关键词

引用

@article{arxiv.2512.22217,
  title  = {VLM-PAR: A Vision Language Model for Pedestrian Attribute Recognition},
  author = {Abdellah Zakaria Sellam and Salah Eddine Bekhouche and Fadi Dornaika and Cosimo Distante and Abdenour Hadid},
  journal= {arXiv preprint arXiv:2512.22217},
  year   = {2025}
}