中文

面向Transformer时序动作检测的长期预训练

计算机视觉与模式识别 2024-09-10 v2

摘要

时序动作检测(TAD)具有挑战性,但对于现实世界的视频应用至关重要。近年来,基于DETR的TAD模型因其独特优势而盛行。然而,Transformer需要海量数据集,不幸的是TAD中的数据稀缺导致了严重的性能退化。本文识别出数据稀缺导致的两个关键问题:注意力崩溃和性能不平衡。为此,我们提出了一种新的预训练策略——长期预训练(LTP),专为Transformer量身定制。LTP包含两个主要部分:1)类别级合成,2)长期前置任务。首先,我们通过合并目标类别和非目标类别的视频片段来合成长时间视频特征。它们类似于TAD中使用的未修剪数据,尽管是从修剪数据创建的。此外,我们设计了两种类型的长期前置任务来学习长期依赖关系。它们施加了长期条件,例如查找第二到第四个动作或短时动作。我们的大量实验表明,在ActivityNet-v1.3和THUMOS14上,基于DETR的方法取得了最先进的性能,且优势明显。此外,我们证明LTP显著缓解了TAD中的数据稀缺问题。

关键词

引用

@article{arxiv.2408.13152,
  title  = {Long-term Pre-training for Temporal Action Detection with Transformers},
  author = {Jihwan Kim and Miso Lee and Jae-Pil Heo},
  journal= {arXiv preprint arXiv:2408.13152},
  year   = {2024}
}