用于时序动作定位的自适应感知Transformer
计算机视觉与模式识别
2022-09-16 v2
摘要
时序动作定位旨在预测未剪辑长视频中每个动作实例的边界和类别。大多数基于锚点或提案的先前方法忽略了整个视频序列中的全局-局部上下文交互。此外,它们的多阶段设计无法直截了当地生成动作边界和类别。为解决上述问题,本文提出一种端到端模型,称为自适应感知Transformer(简称AdaPerFormer)。具体而言,AdaPerFormer探索了一种双分支注意力机制。一个分支负责全局感知注意力,可对整段视频序列建模并聚合全局相关上下文。而另一分支专注于局部卷积偏移,通过我们的双向偏移操作聚合帧内和帧间信息。端到端特性无需额外步骤即可生成视频动作的边界和类别。我们提供了大量实验及消融研究以揭示我们设计的有效性。我们的方法在THUMOS14和ActivityNet-1.3数据集上取得了具有竞争力的性能。
引用
@article{arxiv.2208.11908,
title = {Adaptive Perception Transformer for Temporal Action Localization},
author = {Yizheng Ouyang and Tianjin Zhang and Weibo Gu and Hongfa Wang},
journal= {arXiv preprint arXiv:2208.11908},
year = {2022}
}