TALLFormer:基于长时记忆 Transformer 的时间动作定位
计算机视觉与模式识别
2022-07-28 v2
摘要
现代多数时间动作定位方法将该问题分为两部分:(i)短期特征提取与(ii)长程时间边界定位。由于处理长未修剪视频导致的高 GPU 内存成本,许多方法通过冻结骨干网络或采用较小空间视频分辨率来牺牲短期特征提取器的表征能力。该问题在近期视频 transformer 模型中更为严重,其中许多具有二次内存复杂度。为解决这些问题,我们提出 TALLFormer,一种具有长时记忆、内存高效且端到端可训练的时间动作定位 Transformer。我们的长时记忆机制消除了每次训练迭代中处理数百冗余视频帧的需要,从而显著降低 GPU 内存消耗与训练时间。这些效率节省使我们能够(i)使用强大的视频 transformer 特征提取器而不冻结骨干或降低空间视频分辨率,同时(ii)保持长程时间边界定位能力。仅以 RGB 帧为输入且无需外部动作识别分类器,TALLFormer 大幅优于先前 SOTA,在 THUMOS14 上取得平均 mAP 59.1%,在 ActivityNet-1.3 上取得 35.6%。代码已公开:https://github.com/klauscc/TALLFormer。
引用
@article{arxiv.2204.01680,
title = {TALLFormer: Temporal Action Localization with a Long-memory Transformer},
author = {Feng Cheng and Gedas Bertasius},
journal= {arXiv preprint arXiv:2204.01680},
year = {2022}
}
备注
Accepted by ECCV 2022