中文

面向零样本动作识别的语言-骨架全息表征:基于部件感知的统一表示

计算机视觉与模式识别 2024-06-21 v1

摘要

尽管在监督式骨架基础动作识别方面取得了显著进展,但零样本识别挑战仍相对未被充分探索。在本文中,我们认为仅靠对齐标签级语义与全局骨架特征是不足以有效将已见类别中局部一致的视觉知识传递到未见类别的。为此,我们引入了在语言与骨架之间构建部件感知统一表征的框架(Part-aware Unified Representation between Language and Skeleton, PURLS),以探索局部与全局尺度的视觉-语义对齐。PURLS引入了新的提示模块和 novel 分区模块,用于生成跨不同层次的对齐文本与视觉表征。前者利用预训练的 GPT-3 从原始动作标签中推断全局表述与局部(基于身体部位和时间区间的)运动细化描述。后者采用自适应抽样策略,将与给定表述语义相关的所有身体关节运动的视觉特征进行分组。我们在 various 骨架/语言 backbone 以及三个大规模数据集上进行评估,即 NTU-RGB+D 60、NTU-RGB+D 120 以及一个新建的数据集 Kinetics-skeleton 200。结果表明,PURLS 的通用性和优异性能优于先前的骨架基于方法以及其他领域的标准基线。源代码可在 https://github.com/azzh1/PURLS 获取。

关键词

引用

@article{arxiv.2406.13327,
  title  = {Part-aware Unified Representation of Language and Skeleton for Zero-shot Action Recognition},
  author = {Anqi Zhu and Qiuhong Ke and Mingming Gong and James Bailey},
  journal= {arXiv preprint arXiv:2406.13327},
  year   = {2024}
}