中文

ViLP:利用视觉、语言与姿态嵌入进行知识探索的视频动作识别

计算机视觉与模式识别 2023-08-09 v1 人工智能 机器学习

摘要

视频动作识别(VAR)因其固有复杂性而是一项具挑战性的任务。尽管文献中已探索不同方法,设计统一框架以识别大量人类动作仍是难题。近来,多模态学习(MML)在该领域展现出有前景的结果。文献中,2D 骨架或姿态模态常独立或与视频中视觉信息(RGB 模态)结合用于此任务。然而,尽管文本与姿态属性各自已在众多计算机视觉任务中被证明有效,姿态、视觉信息与文本属性的组合尚未被探索。本文中,我们提出首个用于 VAR 的姿态增强视觉-语言模型(VLM)。值得注意的是,即使在无任何视频数据预训练下,我们的方案在两个流行人类视频动作识别基准数据集 UCF-101 和 HMDB-51 上分别达到 92.81% 和 73.02% 准确率,而在 kinetics 预训练后准确率为 96.11% 和 75.75%。

关键词

引用

@article{arxiv.2308.03908,
  title  = {ViLP: Knowledge Exploration using Vision, Language, and Pose Embeddings for Video Action Recognition},
  author = {Soumyabrata Chaudhuri and Saumik Bhattacharya},
  journal= {arXiv preprint arXiv:2308.03908},
  year   = {2023}
}

备注

7 pages, 3 figures, 2 Tables