中文

预期视频Transformer

计算机视觉与模式识别 2021-09-23 v2 人工智能 机器学习 多媒体

摘要

我们提出Anticipative Video Transformer (AVT),一种端到端的基于注意力的视频建模架构,其关注先前观测到的视频以预期未来动作。我们联合训练该模型以预测视频序列中的下一动作,同时学习可预测后续未来帧特征的帧特征编码器。与现有时间聚合策略相比,AVT的优势在于既保持已观测动作的顺序推进,又捕捉长程依赖——二者对预期任务均至关重要。通过大量实验,我们表明AVT在四个流行的动作预期基准上取得了已报道的最佳性能:EpicKitchens-55、EpicKitchens-100、EGTEA Gaze+与50-Salads;并在EpicKitchens-100 CVPR'21挑战赛中荣获第一名。

关键词

引用

@article{arxiv.2106.02036,
  title  = {Anticipative Video Transformer},
  author = {Rohit Girdhar and Kristen Grauman},
  journal= {arXiv preprint arXiv:2106.02036},
  year   = {2021}
}

备注

ICCV 2021. Ranked #1 in CVPR'21 EPIC-Kitchens-100 Action Anticipation challenge. Webpage/code/models: http://facebookresearch.github.io/AVT