中文

OpenTAD:时序动作检测的统一框架与全面研究

计算机视觉与模式识别 2025-02-28 v1

摘要

时序动作检测(TAD)是视频理解中的基础任务,旨在识别视频中人类动作并定位其时序边界。尽管近年来该领域取得了显著进展,但由于缺乏标准化框架,进一步的进展和实际应用仍受阻。目前,不同方法在不同的实现设置、评估协议下进行比较,难以评估特定技术的真实有效性。为此,我们提出了—OpenTAD—a 一个统一的TAD框架,将16种不同的TAD方法和9个标准数据集整合到模块化代码库中。在OpenTAD中,仅需最小的工作量即可用不同设计替换模块、以端到端模式训练基于特征的TAD模型,或在两者之间切换。OpenTAD还简化了跨数据集的基准测试, enables 对不同方法进行公平且深入的比较。通过OpenTAD,我们全面研究了不同网络组件创新对检测性能的影响,并通过大量实验识别出最有效的设计选择。这一研究导致了一个基于现有技术构建的新型SOTA TAD方法。我们已在https://github.com/sming256/OpenTAD上发布代码和模型。

关键词

引用

@article{arxiv.2502.20361,
  title  = {OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection},
  author = {Shuming Liu and Chen Zhao and Fatimah Zohra and Mattia Soldan and Alejandro Pardo and Mengmeng Xu and Lama Alssum and Merey Ramazanova and Juan León Alcázar and Anthony Cioppa and Silvio Giancola and Carlos Hinojosa and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2502.20361},
  year   = {2025}
}