以 Patch 为节点:面向多模态动作识别的以人为中心的图表示学习
计算机视觉与模式识别
2025-12-29 v1
摘要
尽管人类动作识别已取得显著成就,但融合 RGB 和骨架模态的多模态方法仍受制于其固有的异构性,且未能充分利用两者间的互补潜力。在本文中,我们提出了 PAN,这是首个面向多模态动作识别的以人为中心的图表示学习框架,其中包含人体关节的 RGB patch 的 token 嵌入被表示为时空图。以人为中心的图建模范式抑制了 RGB 帧中的冗余,并与基于骨架的方法良好对齐,从而实现了多模态特征更有效且语义连贯的融合。由于 token 嵌入的采样严重依赖于 2D 骨架数据,我们进一步提出了基于注意力的后校准,以在模型性能损失最小的代价下降低对高质量骨架数据的依赖。为探索 PAN 与基于骨架方法结合的潜力,我们提出了两种变体:采用双路径图卷积网络并进行后期融合的 PAN-Ensemble,以及在单一网络内执行统一图表示学习的 PAN-Unified。在三个广泛使用的多模态动作识别数据集上,PAN-Ensemble 和 PAN-Unified 在各自的多模态融合设置(即分离建模和统一建模)中均取得了最先进(SOTA)的性能。
引用
@article{arxiv.2512.21916,
title = {Patch as Node: Human-Centric Graph Representation Learning for Multimodal Action Recognition},
author = {Zeyu Liang and Hailun Xia and Naichuan Zheng},
journal= {arXiv preprint arXiv:2512.21916},
year = {2025}
}