ActivityNet Challenge 2022 技术报告 -- 时序动作定位
计算机视觉与模式识别
2024-11-05 v1
摘要
在 ActivityNet-1.3 数据集的时序动作定位任务中,我们提出定位每个动作的时序边界并在未裁剪视频中预测动作类别。我们首先采用 VideoSwinTransformer 作为特征提取器来提取不同特征。然后采用遵循 Faster-TAD 的统一网络同时获取提议和语义标签。最后,我们对互补的不同时序动作检测模型的结果进行集成。Faster-TAD 简化了 TAD 流程并取得了显著性能,获得了与多步骤方法相当的结果。
引用
@article{arxiv.2411.00883,
title = {Technical Report for ActivityNet Challenge 2022 -- Temporal Action Localization},
author = {Shimin Chen and Wei Li and Jianyang Gu and Chen Chen and Yandong Guo},
journal= {arXiv preprint arXiv:2411.00883},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2204.02674