用于时空预测学习的Triplet注意力Transformer
计算机视觉与模式识别
2023-10-31 v1 机器学习
摘要
时空预测学习提供了一种自监督学习范式,使模型能够通过基于历史序列预测未来序列来同时学习空间和时间模式。主流方法以循环单元为主导,但它们受限于缺乏并行化能力,且在真实场景中的表现往往不佳。为了在保持计算效率的同时提升预测质量,我们提出了一种创新的Triplet注意力Transformer,旨在同时捕捉帧间动态与帧内静态特征。具体而言,该模型引入了Triplet注意力模块(TAM),通过在时间、空间和通道维度上探索自注意力机制来替代传统循环单元。在此配置中:(i) 时间令牌包含帧间的抽象表示,有助于捕捉固有的时间依赖关系;(ii) 空间与通道注意力相结合,通过跨空间和通道维度的细粒度交互来精炼帧内表示。交替进行时间、空间和通道级注意力使我们的方法能够学习更复杂的短程与长程时空依赖。大量实验表明,该方法性能超越现有的基于循环和无循环的方法,在包括运动物体轨迹预测、交通流预测、驾驶场景预测和人体动作捕捉在内的多场景评测中达到了最先进水平(SOTA)。
引用
@article{arxiv.2310.18698,
title = {Triplet Attention Transformer for Spatiotemporal Predictive Learning},
author = {Xuesong Nie and Xi Chen and Haoyuan Jin and Zhihang Zhu and Yunfeng Yan and Donglian Qi},
journal= {arXiv preprint arXiv:2310.18698},
year = {2023}
}
备注
Accepted to WACV 2024