中文

面向上下文感知时序动作定位的层次化多阶段Transformer架构

计算机视觉与模式识别 2025-07-21 v2

摘要

受近期Transformer和多阶段架构在视频识别和目标检测领域成功的启发,我们深入探索了Transformer在时空属性丰富的多阶段架构范式中用于时序动作定位(TAL)任务的潜力。这一探索导致开发了一种层次化多阶段Transformer架构,称为PCL-Former,其中每个子任务由专用的Transformer模块和专门的损失函数处理。具体而言,Proposal-Former识别未剪辑视频中可能包含动作的候选片段,Classification-Former对这些片段中的动作类别进行分类,Localization-Former精确预测动作实例的时间边界(即开始和结束)。为评估我们方法的性能,我们在三个具有挑战性的基准数据集上进行了大量实验:THUMOS-14、ActivityNet-1.3和HACS Segments。我们还进行了详细的消融实验来评估PCL-Former每个单独模块的影响。所得定量结果验证了所提出PCL-Former的有效性,在THUMOS14、ActivityNet-1.3和HACS数据集上分别超过最先进的TAL方法提高了2.8%、1.2%和4.8%。

关键词

引用

@article{arxiv.2507.06411,
  title  = {Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization},
  author = {Hayat Ullah and Arslan Munir and Oliver Nina},
  journal= {arXiv preprint arXiv:2507.06411},
  year   = {2025}
}

备注

17 pages, 6 figures,