中文

基于分层跨模态超图学习的行人属性识别

计算机视觉与模式识别 2025-09-29 v1 人工智能

摘要

当前的行人属性识别(PAR)算法通常侧重于将视觉特征映射到语义标签,或试图通过融合视觉与属性信息来增强学习。然而,这些方法未能充分利用属性知识与上下文信息以实现更准确的识别。尽管近期工作开始考虑使用属性文本作为额外输入以增强视觉与语义信息之间的关联,但这些方法仍处于起步阶段。为了应对上述挑战,本文提出构建一个多模态知识图谱,用于挖掘局部视觉特征与文本之间的关系,以及属性与广泛视觉上下文样本之间的关系。具体而言,我们提出了一种有效的多模态知识图谱构建方法,充分考虑了属性之间的关系以及属性与视觉 token 之间的关系。为了有效地对这些关系进行建模,本文引入了一个知识图谱引导的跨模态超图学习框架,以增强标准的行人属性识别框架。在多个 PAR 基准数据集上的综合实验充分证明了我们提出的知识图谱在 PAR 任务中的有效性,为知识引导的行人属性识别奠定了坚实基础。本文的源代码将发布于 https://github.com/Event-AHU/OpenPAR

关键词

引用

@article{arxiv.2509.22331,
  title  = {Pedestrian Attribute Recognition via Hierarchical Cross-Modality HyperGraph Learning},
  author = {Xiao Wang and Shujuan Wu and Xiaoxia Cheng and Changwei Bi and Jin Tang and Bin Luo},
  journal= {arXiv preprint arXiv:2509.22331},
  year   = {2025}
}

备注

The First Work that Exploits Multi-modal Knowledge Graph for Pedestrian Attribute Recognition