TemporalMaxer:仅用最大池化最大化时间上下文的时序动作定位方法
计算机视觉与模式识别
2023-03-17 v1
摘要
时序动作定位(TAL)是视频理解中的一项具有挑战性的任务,旨在识别并定位视频序列中的动作。近期研究强调了对提取的视频片段特征应用长期时间上下文建模(TCM)模块(例如采用复杂的自注意力机制)的重要性。在本文中,我们提出了迄今为止解决该任务的最简单方法,并论证提取的视频片段特征已具备充分信息,无需复杂架构即可取得优异性能。为此,我们引入了 TemporalMaxer,它在最小化长期时间上下文建模的同时,通过基础的、无参数的、局部区域操作的最大池化块最大化提取的视频片段特征中的信息。该块仅挑选出相邻和局部片段嵌入中最关键的信息,从而得到一个更高效的 TAL 模型。我们证明,在多个 TAL 数据集上,TemporalMaxer 优于其他利用长期 TCM(如自注意力)的 SOTA 方法,同时所需参数和计算资源显著更少。我们的方法代码已公开于 https://github.com/TuanTNG/TemporalMaxer
引用
@article{arxiv.2303.09055,
title = {TemporalMaxer: Maximize Temporal Context with only Max Pooling for Temporal Action Localization},
author = {Tuan N. Tang and Kwonyoung Kim and Kwanghoon Sohn},
journal= {arXiv preprint arXiv:2303.09055},
year = {2023}
}