SF-Net:用于时序动作定位的单帧监督
计算机视觉与模式识别
2020-08-18 v6 机器学习
图像与视频处理
摘要
本文研究一种中间形式的监督,即单帧监督,用于时序动作定位(TAL)。为获取单帧监督,标注者仅需识别动作时间窗内的一帧。这可显著减少获取需标注动作边界的全监督的人力成本。相较于仅标注视频级标签的弱监督,单帧监督引入了额外时序动作信号,同时保持低标注开销。为充分利用此类单帧监督,我们提出称为 SF-Net 的统一系统。首先,我们提出为每视频帧预测动作性分数。结合典型类别分数,动作性分数可提供潜在动作发生的全面信息,并辅助推理阶段的时间边界精炼。其次,我们基于单帧标注挖掘伪动作与背景帧。我们通过将每标注单帧自适应扩展至其邻近上下文帧来识别伪动作帧,并从多视频所有未标注帧中挖掘伪背景帧。这些伪标注帧与真值标注帧一起进一步用于训练分类器。在 THUMOS14、GTEA 与 BEOID 上的大量实验中,SF-Net 在片段定位与单帧定位上均显著优于最先进弱监督方法。值得注意的是,SF-Net 取得了与其需密集资源标注的全监督对应方法相当的结果。代码见 https://github.com/Flowerfan/SF-Net。
引用
@article{arxiv.2003.06845,
title = {SF-Net: Single-Frame Supervision for Temporal Action Localization},
author = {Fan Ma and Linchao Zhu and Yi Yang and Shengxin Zha and Gourab Kundu and Matt Feiszli and Zheng Shou},
journal= {arXiv preprint arXiv:2003.06845},
year = {2020}
}
备注
ECCV 2020