中文

文本驱动视频加速:一种弱监督强化学习方法

计算机视觉与模式识别 2022-03-30 v1

摘要

数字时代视频的激增与用户时间的有限提升了对未剪辑视频进行处理以生成传达相同信息的更短版本的需求。尽管摘要方法已取得显著进展,但大多数只能选取少量帧或进行略读,造成视觉断层并破坏视频上下文。本文提出一种基于强化学习公式、利用文本加速教学视频的新型弱监督方法。一种新型联合奖励函数引导智能体选择移除哪些帧,并将输入视频缩减至目标长度,且不在最终视频中产生断层。我们还提出扩展的视觉引导文档注意力网络(VDAN+),其能生成高度判别性的嵌入空间来表示文本与视觉数据。实验表明,我们的方法在精确率、召回率与 F1 分数上均优于基线,同时有效控制视频输出长度。代码与额外结果见 https://www.verlab.dcc.ufmg.br/semantic-hyperlapse/tpami2022/。

关键词

引用

@article{arxiv.2203.15778,
  title  = {Text-Driven Video Acceleration: A Weakly-Supervised Reinforcement Learning Method},
  author = {Washington Ramos and Michel Silva and Edson Araujo and Victor Moura and Keller Oliveira and Leandro Soriano Marcolino and Erickson R. Nascimento},
  journal= {arXiv preprint arXiv:2203.15778},
  year   = {2022}
}

备注

Accepted to the IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 2022. arXiv admin note: text overlap with arXiv:2003.14229