中文

以 Patch 为节点:面向多模态动作识别的以人为中心的图表示学习

计算机视觉与模式识别 2025-12-29 v1

摘要

尽管人类动作识别已取得显著成就,但融合 RGB 和骨架模态的多模态方法仍受制于其固有的异构性,且未能充分利用两者间的互补潜力。在本文中,我们提出了 PAN,这是首个面向多模态动作识别的以人为中心的图表示学习框架,其中包含人体关节的 RGB patch 的 token 嵌入被表示为时空图。以人为中心的图建模范式抑制了 RGB 帧中的冗余,并与基于骨架的方法良好对齐,从而实现了多模态特征更有效且语义连贯的融合。由于 token 嵌入的采样严重依赖于 2D 骨架数据,我们进一步提出了基于注意力的后校准,以在模型性能损失最小的代价下降低对高质量骨架数据的依赖。为探索 PAN 与基于骨架方法结合的潜力,我们提出了两种变体:采用双路径图卷积网络并进行后期融合的 PAN-Ensemble,以及在单一网络内执行统一图表示学习的 PAN-Unified。在三个广泛使用的多模态动作识别数据集上,PAN-Ensemble 和 PAN-Unified 在各自的多模态融合设置(即分离建模和统一建模)中均取得了最先进(SOTA)的性能。

关键词

引用

@article{arxiv.2512.21916,
  title  = {Patch as Node: Human-Centric Graph Representation Learning for Multimodal Action Recognition},
  author = {Zeyu Liang and Hailun Xia and Naichuan Zheng},
  journal= {arXiv preprint arXiv:2512.21916},
  year   = {2025}
}