中文

基于原型引导特征对齐的零样骨架基础动作识别

计算机视觉与模式识别 2025-07-25 v2

摘要

零样骨架基础动作识别旨在在训练期间不对见到的骨架基础人类动作类别进行先验暴露,从而对这些类别进行分类。这一任务极具挑战性,因为从已知动作推广到未知动作困难。以往研究通常采用两种阶段进行训练:首先使用交叉熵损失在看到的动作类别上预训练骨架编码器,然后对预提取的骨架和文本特征进行对齐,通过骨架-文本对齐和语言模型的泛化实现对未知类别的知识迁移。然而,这些方法的有效性受到以下两个方面的限制:1)骨架特征的判别性不足,因为固定的骨架编码器无法捕获必要的对齐信息以实现有效的骨架-文本对齐;2)在测试期间忽略了骨架与未见文本特征之间的对齐偏差。为此,我们提出了一种原型引导特征对齐范式用于零样骨架基础动作识别,称为 PGFA。具体而言,我们开发了一个端到端的交叉模态对比训练框架以提高骨架-文本对齐,确保骨架特征的充分判别性。此外,我们引入一种原型引导文本特征对齐策略以缓解测试期间分布差异的不利影响。我们提供理论分析以支持我们的原型引导文本特征对齐策略,并在三个著名数据集上对整个 PGFA 进行了经验评估。与顶级竞争者 SMIE 方法相比,我们在 NTU-60、NTU-120 和 PKU-MMD 数据集上分别实现了 22.96%、12.53% 和 18.54% 的绝对准确率提升。

关键词

引用

@article{arxiv.2507.00566,
  title  = {Zero-Shot Skeleton-Based Action Recognition With Prototype-Guided Feature Alignment},
  author = {Kai Zhou and Shuhai Zhang and Zeng You and Jinwu Hu and Mingkui Tan and Fei Liu},
  journal= {arXiv preprint arXiv:2507.00566},
  year   = {2025}
}

备注

This paper is accepted by IEEE TIP 2025 (The journal version is available at https://doi.org/10.1109/TIP.2025.3586487). Code is publicly available at https://github.com/kaai520/PGFA