行人属性识别:新基准数据集与大规模语言模型增强框架
计算机视觉与模式识别
2024-08-20 v1 人工智能
计算与语言
摘要
行人属性识别(PAR)是以人为中心的研究中不可或缺的任务之一。然而,现有数据集忽略了不同领域(如环境、时间、人群和数据来源),仅进行简单的随机分割,且这些数据集的性能已接近饱和。在过去五年中,没有大规模数据集向公众开放。为了解决这一问题,本文提出了一种新的大规模跨域行人属性识别数据集 MSP60K 以填补数据空白。它包含 60,122 张图像和 57 个属性注释,涵盖八个场景。还进行了合成退化以进一步缩小数据集与真实世界挑战场景之间的差距。为了建立更严格的基准,我们在数据集上对 17 种代表性 PAR 模型在随机分割和跨域分割两种协议下进行了评估。此外,我们提出了一种创新的大规模语言模型(LLM)增强 PAR 框架 LLM-PAR。该框架通过视觉 Transformer(ViT)骨干网络处理行人图像以提取特征,并引入多嵌入查询 Transformer 以学习用于属性分类的部分感知特征。显著地,我们通过 LLM 增强了该框架的集成学习和视觉特征增强。在多个 PAR 基准数据集上的全面实验彻底验证了所提出框架的有效性。本文的数据集和源代码将在 \url{https://github.com/Event-AHU/OpenPAR} 公开发布。
引用
@article{arxiv.2408.09720,
title = {Pedestrian Attribute Recognition: A New Benchmark Dataset and A Large Language Model Augmented Framework},
author = {Jiandong Jin and Xiao Wang and Qian Zhu and Haiyang Wang and Chenglong Li},
journal= {arXiv preprint arXiv:2408.09720},
year = {2024}
}
备注
MSP60K PAR Benchmark Dataset, LLM based PAR model, In Peer Review