中文

频率增强扩散模型:面向零样本骨架动作识别的课程导向语义对齐

计算机视觉与模式识别 2026-05-08 v2 人工智能

摘要

人类动作识别是计算机视觉中的关键任务,适用于从监控到人机交互等多个场景。尽管监督骨架基方法效果良好,但依赖详尽标注限制了对新动作的泛化。零样本骨架动作识别(ZSAR)已成为有前景的范式,但面临扩散模型的谱偏差问题,即过度平滑高频动态。为此,我们提出 Frequency-Aware Diffusion for Skeleton-Text Matching(FDSM),集成语义导向谱残模块、时序自适应谱损失和课程化语义抽象。我们的做法有效恢复细粒度运动细节,在 NTU RGB+D、PKU-MMD 和 Kinetics-skeleton 数据集上实现了最先进的性能。代码已公开于 https://github.com/yuzhi535/FDSM。项目主页:https://yuzhi535.github.io/FDSM.github.io/。

关键词

引用

@article{arxiv.2604.09063,
  title  = {Frequency-Enhanced Diffusion Models: Curriculum-Guided Semantic Alignment for Zero-Shot Skeleton Action Recognition},
  author = {Yuxi Zhou and Zhengbo Zhang and Jingyu Pan and Zhiyu Lin and Zhigang Tu},
  journal= {arXiv preprint arXiv:2604.09063},
  year   = {2026}
}

备注

Accepted by The Visual Computer