中文

ActivityNet Challenge 2022 技术报告 -- 时序动作定位

计算机视觉与模式识别 2024-11-05 v1

摘要

在 ActivityNet-1.3 数据集的时序动作定位任务中,我们提出定位每个动作的时序边界并在未裁剪视频中预测动作类别。我们首先采用 VideoSwinTransformer 作为特征提取器来提取不同特征。然后采用遵循 Faster-TAD 的统一网络同时获取提议和语义标签。最后,我们对互补的不同时序动作检测模型的结果进行集成。Faster-TAD 简化了 TAD 流程并取得了显著性能,获得了与多步骤方法相当的结果。

关键词

引用

@article{arxiv.2411.00883,
  title  = {Technical Report for ActivityNet Challenge 2022 -- Temporal Action Localization},
  author = {Shimin Chen and Wei Li and Jianyang Gu and Chen Chen and Yandong Guo},
  journal= {arXiv preprint arXiv:2411.00883},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2204.02674