预期视频Transformer
计算机视觉与模式识别
2021-09-23 v2 人工智能
机器学习
多媒体
摘要
我们提出Anticipative Video Transformer (AVT),一种端到端的基于注意力的视频建模架构,其关注先前观测到的视频以预期未来动作。我们联合训练该模型以预测视频序列中的下一动作,同时学习可预测后续未来帧特征的帧特征编码器。与现有时间聚合策略相比,AVT的优势在于既保持已观测动作的顺序推进,又捕捉长程依赖——二者对预期任务均至关重要。通过大量实验,我们表明AVT在四个流行的动作预期基准上取得了已报道的最佳性能:EpicKitchens-55、EpicKitchens-100、EGTEA Gaze+与50-Salads;并在EpicKitchens-100 CVPR'21挑战赛中荣获第一名。
引用
@article{arxiv.2106.02036,
title = {Anticipative Video Transformer},
author = {Rohit Girdhar and Kristen Grauman},
journal= {arXiv preprint arXiv:2106.02036},
year = {2021}
}
备注
ICCV 2021. Ranked #1 in CVPR'21 EPIC-Kitchens-100 Action Anticipation challenge. Webpage/code/models: http://facebookresearch.github.io/AVT