ViTA-PAR:基于属性提示的视觉与文本属性对齐用于行人属性识别
计算机视觉与模式识别
2025-10-17 v1 人工智能
摘要
行人属性识别(PAR)任务旨在识别个体的各种详细属性,如衣着、配饰和性别。为了提升 PAR 性能,模型必须捕获从粗粒度全局属性(例如用于识别性别)到可能出现在不同区域的细粒度局部细节(例如用于识别配饰)的特征。最近的研究表明,身体部位表示可以增强模型的鲁棒性和准确性,但这些方法通常局限于固定水平区域内的属性类别,当属性出现在变化或意外的身体位置时,会导致性能下降。在本文中,我们提出了基于属性提示的视觉与文本属性对齐用于行人属性识别(简称 ViTA-PAR),通过专门的多模态提示和视觉-语言对齐来增强属性识别。我们引入了捕获全局到局部语义的视觉属性提示,从而实现多样化的属性表示。为了丰富文本嵌入,我们设计了一个可学习的提示模板,称为人与属性上下文提示,以学习人与属性的上下文。最后,我们对齐视觉和文本属性特征以实现有效融合。ViTA-PAR 在四个 PAR 基准上进行了验证,以高效的推理实现了极具竞争力的性能。我们在 https://github.com/mlnjeongpark/ViTA-PAR 发布了代码和模型。
引用
@article{arxiv.2506.01411,
title = {ViTA-PAR: Visual and Textual Attribute Alignment with Attribute Prompting for Pedestrian Attribute Recognition},
author = {Minjeong Park and Hongbeen Park and Jinkyu Kim},
journal= {arXiv preprint arXiv:2506.01411},
year = {2025}
}
备注
Accepted to IEEE ICIP 2025