面向上下文感知时序动作定位的层次化多阶段Transformer架构
计算机视觉与模式识别
2025-07-21 v2
摘要
受近期Transformer和多阶段架构在视频识别和目标检测领域成功的启发,我们深入探索了Transformer在时空属性丰富的多阶段架构范式中用于时序动作定位(TAL)任务的潜力。这一探索导致开发了一种层次化多阶段Transformer架构,称为PCL-Former,其中每个子任务由专用的Transformer模块和专门的损失函数处理。具体而言,Proposal-Former识别未剪辑视频中可能包含动作的候选片段,Classification-Former对这些片段中的动作类别进行分类,Localization-Former精确预测动作实例的时间边界(即开始和结束)。为评估我们方法的性能,我们在三个具有挑战性的基准数据集上进行了大量实验:THUMOS-14、ActivityNet-1.3和HACS Segments。我们还进行了详细的消融实验来评估PCL-Former每个单独模块的影响。所得定量结果验证了所提出PCL-Former的有效性,在THUMOS14、ActivityNet-1.3和HACS数据集上分别超过最先进的TAL方法提高了2.8%、1.2%和4.8%。
关键词
引用
@article{arxiv.2507.06411,
title = {Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization},
author = {Hayat Ullah and Arslan Munir and Oliver Nina},
journal= {arXiv preprint arXiv:2507.06411},
year = {2025}
}
备注
17 pages, 6 figures,