中文

骨架-片段对比学习与多尺度特征融合用于动作定位

计算机视觉与模式识别 2026-05-06 v3

摘要

自监督预训练范式在学习用于骨架动作识别的三维动作表征方面取得了巨大成功。然而,学习用于骨架基时间动作定位的有效表征仍然具有挑战性且尚未被充分探索。与视频级动作识别不同,检测动作边界需要时间敏感的特征来捕捉标签变化的相邻帧之间的细微差异。为此,我们制定了一个片段判别预训练任务用于自监督预训练,该任务将骨架序列密集地投影到非重叠片段上,并通过对比学习促进跨视频区分这些片段的特征。此外,我们通过 U 形模块融合中间特征来构建骨架动作识别模型的强骨干网络,以增强帧级定位的特征分辨率。我们的方法在 BABEL 数据集的不同子集和评估协议上持续改进了现有的骨架基对比学习方法用于动作定位。我们还在 NTU RGB+D 和 BABEL 上预训练,在 PKUMMD 上取得了最先进的迁移学习性能。

关键词

引用

@article{arxiv.2512.16504,
  title  = {Skeleton-Snippet Contrastive Learning with Multiscale Feature Fusion for Action Localization},
  author = {Qiushuo Cheng and Jingjing Liu and Catherine Morgan and Alan Whone and Majid Mirmehdi},
  journal= {arXiv preprint arXiv:2512.16504},
  year   = {2026}
}

备注

Accepted in ICPR'26