用于视频动作预测的高阶循环时空 Transformer
计算机视觉与模式识别
2021-09-22 v3
摘要
赋予视觉智能体预测能力是迈向大规模视频智能的关键一步。对此的主流建模范式为序列学习,主要通过 LSTM 实现。前馈 Transformer 架构已在语言处理的机器学习应用中取代循环模型设计,并在计算机视觉中部分取代。本文中我们探究 Transformer 风格架构在视频预测任务上的竞争力。为此我们提出 HORST,一种新颖的高阶循环层设计,其核心元素是对视频自注意力的时空分解。HORST 在 Something-Something 早期动作识别和 EPIC-Kitchens 动作预期上取得了具有竞争力的 SOTA 性能,展现出预测能力证据,我们将其归因于我们对自注意力的循环高阶设计。
引用
@article{arxiv.2104.08665,
title = {Higher Order Recurrent Space-Time Transformer for Video Action Prediction},
author = {Tsung-Ming Tai and Giuseppe Fiameni and Cheng-Kuang Lee and Oswald Lanz},
journal= {arXiv preprint arXiv:2104.08665},
year = {2021}
}