基于全局分割掩码学习的无提案时序动作检测
计算机视觉与模式识别
2022-08-22 v2 人工智能
机器学习
多媒体
摘要
现有的时序动作检测(TAD)方法依赖于为每个视频生成数量极大的提案。这导致由于提案生成和/或逐提案动作实例评估以及由此产生的高计算成本而使模型设计复杂。在本工作中,我们首次提出了一种带有全局分割掩码(TAGS)的无提案时序动作检测模型。我们的核心思想是在整个视频长度上联合学习每个动作实例的全局分割掩码。TAGS模型与传统基于提案的方法显著不同,它专注于全局时序表示学习,以在无提案情况下直接检测动作实例的局部起止点。此外,通过在整体而非单个提案层面的局部来建模TAD,TAGS需要更简单的模型架构和更低的计算成本。大量实验表明,尽管设计更简单,TAGS优于现有TAD方法,在两个基准上实现了新的SOTA性能。重要的是,其训练速度约快20倍,推理效率高约1.6倍。我们的TAGS的PyTorch实现可在 https://github.com/sauradip/TAGS 获取。
引用
@article{arxiv.2207.06580,
title = {Proposal-Free Temporal Action Detection via Global Segmentation Mask Learning},
author = {Sauradip Nag and Xiatian Zhu and Yi-Zhe Song and Tao Xiang},
journal= {arXiv preprint arXiv:2207.06580},
year = {2022}
}
备注
ECCV 2022; Code available at https://github.com/sauradip/TAGS