基于层次化全球-局部骨架-语言模型的 LLM 增强动作识别
计算机视觉与模式识别
2026-03-31 v1
摘要
骨架基准的人类动作识别近年来取得了显著进展。然而,大多数现有的 GCN-based 方法依赖短程运动拓扑,这不仅难以捕获长程关节依赖关系和复杂时序动态,还限制了跨模态语义对齐和理解,因为对动作语义建模不足。为此,我们提出一种层次化全球-局部骨架-语言模型(HocSLM),使大型动作模型更能代表动作语义。首先,我们设计了层次化全球-局部网络(HGLNet),由复合拓扑空间模块和双路径层次时序模块组成。通过协同集成多级全局和局部模块,HGLNet 在全局和局部尺度上实现动态协作建模,同时保留人类物理结构的先验知识,显著提升了模型对复杂时空关系的表示能力。随后,采用大型视觉-语言模型(VLM)生成由原始 RGB 视频序列传递给该模型产生的文本描述,为进一步训练骨架-语言模型提供丰富的动作语义。此外,我们引入一种骨架-语言顺序融合模块,将来自 HGLNet 的特征与生成的描述相结合,该模块使用骨架-语言模型(SLM)在统一语义空间内精确对齐骨架时空特征和文本动作描述。SLM 模型显著提升了 HGLNet 的语义辨识能力和跨模态理解能力。广泛的实验表明,所提出的 HocSLM 在三个主流基准数据集上实现了最先进的性能:NTU RGB+D 60、NTU RGB+D 120 和 Northwestern-UCLA。
引用
@article{arxiv.2603.27103,
title = {LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model},
author = {Ruosi Wang and Fangwei Zuo and Lei Li and Zhaoqiang Xia},
journal= {arXiv preprint arXiv:2603.27103},
year = {2026}
}