中文

面向零样本动作识别的端到端语义视频Transformer

计算机视觉与模式识别 2022-12-05 v2 人工智能

摘要

尽管视频动作识别多年来一直是活跃的研究领域,零样本动作识别直到最近才开始受到关注。在本工作中,我们提出一种新颖的端到端训练 Transformer 模型,与现有使用 3D-CNN 的方法不同,其能够高效捕获长程时空依赖。此外,针对现有工作中关于可被视为先前未见类别的常见模糊性,我们提出一种新的实验设置,通过避免训练与测试类别间的重叠,满足动作识别的零样本学习前提。所提方法在 UCF-101、HMDB-51 和 ActivityNet 数据集上以 top-1 准确率显著优于零样本动作识别的现有最优方法。代码与所提实验设置可在 GitHub 获取:https://github.com/Secure-and-Intelligent-Systems-Lab/SemanticVideoTransformer

关键词

引用

@article{arxiv.2203.05156,
  title  = {End-to-End Semantic Video Transformer for Zero-Shot Action Recognition},
  author = {Keval Doshi and Yasin Yilmaz},
  journal= {arXiv preprint arXiv:2203.05156},
  year   = {2022}
}