利用时域多分辨率信息提升弱监督时序动作局部化性能
计算机视觉与模式识别
2025-06-24 v1
摘要
弱监督时序动作局部化是一项具有挑战性的任务,因为训练期间仅提供视频级别的注释。为此,本文提出了一种两阶段方法,充分利用时域中的多分辨率信息,基于外观流和运动流生成高质量的帧级伪标签。具体而言,在第一阶段,我们生成可靠的初始帧级伪标签;在第二阶段,我们迭代细化伪标签,并使用一组置信度极高的选定帧来训练神经网络,以更好地预测每个帧的动作类别得分。我们充分利用多个时间尺度的时序信息以提升时序动作局部化性能。具体而言,为获得可靠的初始帧级伪标签,本文提出了初始标签生成(ILG)模块,利用时序多分辨率一致性生成高质量的类别激活序列(CAS),其中每个序列衡量该视频帧属于特定动作类别的可能性。在第二阶段,本文提出了渐进式时序标签细化(PTLR)框架。在PTLR框架中,两个名为 Network-OTS 和 Network-RTS 的网络分别用于生成原始时序尺度和缩减时序尺度的 CAS,充当两个流(即 OTS 流和 RTS 流)相互细化伪标签。通过这种方式,在伪标签层面上交换时域中的多分辨率信息,使我们的工作能够通过利用来自另一个流(即 RTS/OTS 流)的细化伪标签来提高每个流(即 OTS/RTS 流)的性能。
引用
@article{arxiv.2506.18261,
title = {Improving Weakly Supervised Temporal Action Localization by Exploiting Multi-resolution Information in Temporal Domain},
author = {Rui Su and Dong Xu and Luping Zhou and Wanli Ouyang},
journal= {arXiv preprint arXiv:2506.18261},
year = {2025}
}
备注
13 pages