中文

基于文本导出的关系图增强网络用于骨架基础动作分割

计算机视觉与模式识别 2025-12-15 v1 人工智能

摘要

基于骨架的时序动作分割(STAS)旨在从长时间未剪辑的人体骨架运动序列中进行动作分割与识别。当前的STAS方法通常采用时空建模来建立关节及帧之间的依赖关系,并利用 one-hot 编码和交叉熵损失进行帧级分类监督。然而,这些方法忽略了骨架特征中关节与动作之间的内在关联,导致对人体运动的理解有限。为此,我们提出了一种文本导出关系图增强网络(Text-Derived Relational Graph-Enhanced Network, TRG-Net),其利用大型语言模型(LLM)生成的先验图来增强建模与监督。对于建模,动态时空融合建模(Dynamic Spatio-Temporal Fusion Modeling, DSFM)方法将文本导出关节图(Text-Derived Joint Graphs, TJG)与通道级和帧级动态适配相结合,以有效建模空间关系,同时在时序建模中融合时空核心特征。对于监督,绝对-相对类别间监督(Absolute-Relative Inter-Class Supervision, ARIS)方法利用对比学习在动作特征与文本嵌入之间进行正则化,以规范化类别分布,同时利用文本导出动作图(Text-Derived Action Graphs, TAG)来捕获动作特征之间的相对类别关系。此外,我们提出了一种空间感知增强处理方法(Spatial-Aware Enhancement Processing, SAEP),其包含随机关节遮挡和轴向旋转,以增强空间泛化能力。在四个公开数据集上的性能评估表明,TRG-Net 已实现最先进的效果。

关键词

引用

@article{arxiv.2503.15126,
  title  = {Text-Derived Relational Graph-Enhanced Network for Skeleton-Based Action Segmentation},
  author = {Haoyu Ji and Bowen Chen and Weihong Ren and Wenze Huang and Zhihao Yang and Zhiyong Wang and Honghai Liu},
  journal= {arXiv preprint arXiv:2503.15126},
  year   = {2025}
}