中文

基于强化学习与 3D 时空 U-Net 的视频摘要

计算机视觉与模式识别 2022-02-16 v1

摘要

智能视频摘要算法通过识别最关键和最具解释性的内容并去除冗余视频帧,快速传达视频中最相关的信息。本文中,我们引入用于视频摘要的 3DST-UNet-RL 框架。一个 3D 时空 U-Net 用于高效编码输入视频的时空信息以进行下游强化学习 (RL)。一个 RL 智能体从时空潜在分数中学习,并预测在视频摘要中保留或舍弃某视频帧的动作。我们探究真实的/膨胀的 3D 时空 CNN 特征是否比常用的 2D 图像特征更适合从视频中学习表示。我们的框架可在完全无监督模式和监督训练模式下运行。我们分析了规定摘要长度的影响,并给出了 3DST-UNet-RL 在两个常用通用视频摘要基准上有效性的实验证据。我们还将该方法应用于一项医学视频摘要任务。所提视频摘要方法有望节省超声筛查视频的存储成本,并在回顾性分析或审计中浏览患者视频数据时提高效率而不丢失关键信息。

关键词

引用

@article{arxiv.2106.10528,
  title  = {Video Summarization through Reinforcement Learning with a 3D Spatio-Temporal U-Net},
  author = {Tianrui Liu and Qingjie Meng and Jun-Jie Huang and Athanasios Vlontzos and Daniel Rueckert and Bernhard Kainz},
  journal= {arXiv preprint arXiv:2106.10528},
  year   = {2022}
}