面向零样本动作识别的端到端语义视频Transformer
计算机视觉与模式识别
2022-12-05 v2 人工智能
摘要
尽管视频动作识别多年来一直是活跃的研究领域,零样本动作识别直到最近才开始受到关注。在本工作中,我们提出一种新颖的端到端训练 Transformer 模型,与现有使用 3D-CNN 的方法不同,其能够高效捕获长程时空依赖。此外,针对现有工作中关于可被视为先前未见类别的常见模糊性,我们提出一种新的实验设置,通过避免训练与测试类别间的重叠,满足动作识别的零样本学习前提。所提方法在 UCF-101、HMDB-51 和 ActivityNet 数据集上以 top-1 准确率显著优于零样本动作识别的现有最优方法。代码与所提实验设置可在 GitHub 获取:https://github.com/Secure-and-Intelligent-Systems-Lab/SemanticVideoTransformer
引用
@article{arxiv.2203.05156,
title = {End-to-End Semantic Video Transformer for Zero-Shot Action Recognition},
author = {Keval Doshi and Yasin Yilmaz},
journal= {arXiv preprint arXiv:2203.05156},
year = {2022}
}