中文

面向长期动作预测的Future Transformer

计算机视觉与模式识别 2022-05-30 v1

摘要

从视频预测未来动作的任务对于与现实中的其他主体交互的智能体至关重要。当预测遥远未来的动作时,人类通常会考虑整个动作序列上的长期关系,即不仅包含过去已观测的动作,也包含未来潜在动作。基于类似思路,我们提出一种用于动作预测的端到端注意力模型,称为Future Transformer(FUTR),其利用对所有输入帧与输出token的全局注意力来预测长达数分钟的未来动作序列。与先前的自回归模型不同,所提方法学习以并行解码预测整个未来动作序列,从而实现更准确且快速的长程预测推理。我们在两个长期动作预测标准基准Breakfast和50 Salads上评估了我们的方法,取得了最先进(SOTA)结果。

关键词

引用

@article{arxiv.2205.14022,
  title  = {Future Transformer for Long-term Action Anticipation},
  author = {Dayoung Gong and Joonseok Lee and Manjin Kim and Seong Jong Ha and Minsu Cho},
  journal= {arXiv preprint arXiv:2205.14022},
  year   = {2022}
}

备注

Accepted to CVPR 2022