中文

EgoViT:用于第一人称动作识别的金字塔视频Transformer

计算机视觉与模式识别 2023-03-17 v1

摘要

捕捉手与物体的交互对于从第一人称视频中自主检测人类动作十分重要。本文中,我们提出一种带有动态类令牌生成器的金字塔视频Transformer用于第一人称动作识别。与先前使用相同静态嵌入作为类令牌处理不同输入的视频Transformer不同,我们提出动态类令牌生成器,通过分析手-物交互及相关运动信息为每个输入视频生成类令牌。动态类令牌可通过在后续Transformer层与其他信息令牌通信,将此类信息扩散至整个模型。借助动态类令牌,视频间差异可更显著,有助于模型区分不同输入。此外,传统视频Transformer全局探索时间特征,需要大量计算。然而,第一人称视频常伴随大量背景场景切换,导致远距离帧间不连续。此时盲目降低时间采样率将面临丢失关键信息的风险。因此,我们还提出金字塔架构,从短期高采样率到长期低采样率分层处理视频。借助所提架构,我们在不牺牲模型性能的前提下显著降低了计算成本与内存需求。我们在EPIC-KITCHENS-100与EGTEA Gaze+数据集上与不同基线视频Transformer进行比较。定量与定性结果均表明所提模型能高效提升第一人称动作识别性能。

关键词

引用

@article{arxiv.2303.08920,
  title  = {EgoViT: Pyramid Video Transformer for Egocentric Action Recognition},
  author = {Chenbin Pan and Zhiqi Zhang and Senem Velipasalar and Yi Xu},
  journal= {arXiv preprint arXiv:2303.08920},
  year   = {2023}
}