中文

面向广义零样本基于骨架动作识别的多语义融合模型

计算机视觉与模式识别 2023-09-19 v1

摘要

广义零样本基于骨架的动作识别(GZSSAR)是计算机视觉领域一个新的具有挑战性的问题,其要求模型在没有任何训练样本的情况下识别动作。先前研究仅利用动词短语的动作标签作为语义原型,来学习从基于骨架的动作到共享语义空间的映射。然而,动作标签有限的语义信息限制了骨架特征识别未见动作的泛化能力。为解决此困境,我们提出一种多语义融合(MSF)模型以提升GZSSAR性能,其中收集两类类级文本描述(即动作描述与运动描述)作为辅助语义信息,以增强可泛化骨架特征的学习效能。具体地,预训练语言编码器以动作描述、运动描述及原始类标签为输入,获取每类动作的丰富语义特征,同时实现骨架编码器提取骨架特征。随后,执行基于变分自编码器(VAE)的生成模块以学习骨架与语义特征间的跨模态对齐。最后,构建分类模块识别输入样本的动作类别,其中采用见-未见分类门来预测样本是否来自GZSSAR中的已见动作类。与先前模型对比的优越性能验证了所提MSF模型在GZSSAR上的有效性。

关键词

引用

@article{arxiv.2309.09592,
  title  = {Multi-Semantic Fusion Model for Generalized Zero-Shot Skeleton-Based Action Recognition},
  author = {Ming-Zhe Li and Zhen Jia and Zhang Zhang and Zhanyu Ma and Liang Wang},
  journal= {arXiv preprint arXiv:2309.09592},
  year   = {2023}
}

备注

Accepted by ICIG 2023 (The code has been released at https://github.com/EHZ9NIWI7/MSF-GZSSAR.)