中文

用于视频场景检测的可学习最优序列分组

计算机视觉与模式识别 2022-06-10 v1

摘要

视频场景检测是将视频划分为时间语义章节的任务。这是在尝试分析异构视频内容之前的一个重要预备步骤。最近,最优序列分组(OSG)被提出作为一种强大的无监督解决方案,用于解决视频场景检测问题的一种表述。在这项工作中,我们将OSG的能力扩展到学习范畴。通过赋予其从样本中学习并利用鲁棒优化公式的能力,我们可以提升性能并增强该技术的通用性。我们对在各种配置下将OSG融入深度学习神经网络进行了全面分析。这些配置包括以直接方式学习嵌入、为引导OSG的解而设计的定制损失函数,以及通过OSG流程执行学习的集成模型。通过全面的评估和分析,我们评估了各种配置的优势和行为,并表明我们的可学习OSG方法展现出理想的行为,并且与现有技术相比性能有所提升。

关键词

引用

@article{arxiv.2205.08249,
  title  = {Learnable Optimal Sequential Grouping for Video Scene Detection},
  author = {Daniel Rotman and Yevgeny Yaroker and Elad Amrani and Udi Barzelay and Rami Ben-Ari},
  journal= {arXiv preprint arXiv:2205.08249},
  year   = {2022}
}