中文

蒸馏视觉-语言预训练以协同弱监督时序动作定位

计算机视觉与模式识别 2022-12-20 v1

摘要

弱监督时序动作定位(WTAL)学习仅使用类别标签来检测和分类动作实例。大多数方法广泛采用现成的基于分类的预训练(CBP)来生成用于动作定位的视频特征。然而,分类与定位之间不同的优化目标,使得时序定位结果遭受严重的动作不完整问题。为了在不增加额外标注的情况下解决此问题,本文考虑从视觉-语言预训练(VLP)中蒸馏免费的动作知识,因为我们惊奇地发现,原始 VLP 的定位结果存在动作过度完整的问题,这恰好与 CBP 的结果互补。为了融合这种互补性,我们提出了一个新颖的蒸馏-协同框架,该框架具有两个分支,分别充当 CBP 和 VLP。该框架通过双分支交替训练策略进行优化。具体来说,在 B 步骤中,我们从 CBP 分支蒸馏置信的背景伪标签;而在 F 步骤中,从 VLP 分支蒸馏置信的前景伪标签。结果,双分支的互补性被有效融合,形成了一个强大的联盟。在 THUMOS14 和 ActivityNet1.2 上的大量实验和消融研究表明,我们的方法显著优于最先进的方法。

关键词

引用

@article{arxiv.2212.09335,
  title  = {Distilling Vision-Language Pre-training to Collaborate with Weakly-Supervised Temporal Action Localization},
  author = {Chen Ju and Kunhao Zheng and Jinxiang Liu and Peisen Zhao and Ya Zhang and Jianlong Chang and Yanfeng Wang and Qi Tian},
  journal= {arXiv preprint arXiv:2212.09335},
  year   = {2022}
}

备注

The first two authors share the same contribution