中文

利用文本信息提升弱监督时序动作定位

计算机视觉与模式识别 2023-05-02 v1

摘要

由于缺乏时序标注,当前的弱监督时序动作定位(WTAL)方法普遍陷入过完备或不完备定位。本文旨在从两方面利用文本信息提升 WTAL:(a)判别性目标以扩大类间差异,从而减少过完备;(b)生成性目标以增强类内完整性,从而发现更完备的时序边界。对于判别性目标,我们提出文本-片段挖掘(TSM)机制,其基于动作类别标签构建文本描述,并将文本作为查询来挖掘所有类相关片段。在没有动作时序标注的情况下,TSM 将文本查询与数据集中整个视频进行比较,以挖掘最佳匹配片段并忽略不相关片段。由于不同类别视频中存在共享子动作,仅应用 TSM 过于严格而会忽略语义相关片段,导致不完备定位。我们进一步引入名为视频-文本语言补全(VLC)的生成性目标,其关注视频中所有语义相关片段以补全文本句子。我们在 THUMOS14 和 ActivityNet1.3 上取得了最先进的性能。令人惊讶的是,我们还发现所提方法可无缝应用于现有方法,并明显提升其性能。代码见 https://github.com/lgzlIlIlI/Boosting-WTAL。

关键词

引用

@article{arxiv.2305.00607,
  title  = {Boosting Weakly-Supervised Temporal Action Localization with Text Information},
  author = {Guozhang Li and De Cheng and Xinpeng Ding and Nannan Wang and Xiaoyu Wang and Xinbo Gao},
  journal= {arXiv preprint arXiv:2305.00607},
  year   = {2023}
}

备注

CVPR 2023