用于在线动作理解的记忆与预期 Transformer
计算机视觉与模式识别
2023-08-16 v1
摘要
大多数现有的预测系统是基于记忆的方法,它们试图通过采用各种记忆机制来模仿人类的预测能力,并在记忆依赖的时间建模方面取得了进展。然而,这一范式的一个明显弱点是只能建模有限的历史依赖,而无法超越过去。在本文中,我们重新思考事件演化的时间依赖关系,提出了一种新颖的基于记忆-预期的范式来建模包含过去、现在和未来的完整时间结构。基于该思想,我们提出了记忆与预期 Transformer(MAT),一种基于记忆-预期的方法,以解决在线动作检测与预期任务。此外,由于 MAT 的固有优势,它能够以统一的方式处理在线动作检测与预期任务。所提出的 MAT 模型在 TVSeries、THUMOS'14、HDD 和 EPIC-Kitchens-100 四个具有挑战性的基准上进行了在线动作检测与预期任务的测试,并显著优于所有现有方法。代码见 https://github.com/Echo0125/Memory-and-Anticipation-Transformer。
引用
@article{arxiv.2308.07893,
title = {Memory-and-Anticipation Transformer for Online Action Understanding},
author = {Jiahao Wang and Guo Chen and Yifei Huang and Limin Wang and Tong Lu},
journal= {arXiv preprint arXiv:2308.07893},
year = {2023}
}
备注
ICCV 2023 Camera Ready