中文

基于多级监督的时间动作检测

计算机视觉与模式识别 2021-02-19 v2

摘要

训练视频中的时间动作检测需要大量标注数据,然而此类标注收集成本高昂。将未标注或弱标注数据纳入以训练动作检测模型有助于降低标注成本。本工作中,我们首先引入半监督动作检测(SSAD)任务,混合使用标注与未标注数据,并分析了所提SSAD基线(直接改编自半监督分类任务)中不同类型的错误。为缓解SSAD基线中动作不完整(即缺失动作部分)的主要错误,我们进一步设计了利用前景与背景运动间“独立性”的无监督前景注意力(UFA)模块。随后我们将弱标注数据纳入SSAD,提出具有三级监督的全监督动作检测(OSAD)。设计了一个信息瓶颈(IB)以抑制非动作帧中的场景信息同时保留动作信息,帮助克服OSAD基线中伴随的动作-上下文混淆问题。我们在THUMOS14和ActivityNet1.2上创建的数据划分中针对SSAD和OSAD基线进行了广泛基准测试,并证明了所提UFA和IB方法的有效性。最后,通过探索标注、未标注和弱标注数据的最优标注策略,展示了我们的完整OSAD-IB模型在有限标注预算下的收益。

关键词

引用

@article{arxiv.2011.11893,
  title  = {Temporal Action Detection with Multi-level Supervision},
  author = {Baifeng Shi and Qi Dai and Judy Hoffman and Kate Saenko and Trevor Darrell and Huijuan Xu},
  journal= {arXiv preprint arXiv:2011.11893},
  year   = {2021}
}