中文

视频中的音视频精彩片段检测

计算机视觉与模式识别 2021-02-12 v1 图像与视频处理

摘要

在本文中,我们检验了如下假设:非结构化视频中有趣的事件本质上是音视频的。我们将用于物体识别与场景理解的深度图像表示,与来自音视频情感识别模型的表示相结合。在此集合基础上,我们加入与内容无关的音视频同步表示以及梅尔频率倒谱系数,以捕捉音频的其他内在属性。这些特征被用于一个模块化的有监督模型。我们展示了两项实验的结果:单特征在该任务上有效性的研究,以及每次留出一个特征的消融研究。对于视频摘要任务,我们的结果表明视觉特征承载了最多信息,且引入音视频特征优于仅使用视觉信息。为更好地研究精彩片段检测任务,我们在一个小规模视频片段子集上进行了带有精彩片段标注的试点实验,并在其上微调了我们的最佳模型。结果表明,我们可以将知识从视频摘要任务迁移到专门为精彩片段检测任务训练的模型中。

关键词

引用

@article{arxiv.2102.05811,
  title  = {Audiovisual Highlight Detection in Videos},
  author = {Karel Mundnich and Alexandra Fenster and Aparna Khare and Shiva Sundaram},
  journal= {arXiv preprint arXiv:2102.05811},
  year   = {2021}
}

备注

5 pages, 2 figures, conference paper