中文

多流动态视频摘要

计算机视觉与模式识别 2021-10-18 v4

摘要

随着每分钟都有海量视频内容上传至互联网,视频摘要对于视觉内容的高效浏览、搜索和索引变得至关重要。然而,社交和第一人称摄像头的普及产生了由多台设备捕捉的丰富稀疏场景,最终需要被联合摘要。本文中,我们讨论了由若干动态摄像头独立录制且间歇性共享视场的视频摘要问题。我们提出了一个鲁棒框架,其(a)在经常未捕捉同一场景的运动摄像头间识别一组多样的重要事件,且(b)在每个事件中选择最具代表性的视角纳入统一摘要。由于缺乏适用的替代方案,我们采集了一个新的多视角第一人称数据集Multi-Ego。我们的数据集由三个摄像头同时录制,涵盖广泛的真实生活场景。该 footage 由多名个体在不同摘要配置下标注,并通过一致性分析确保可靠的 ground truth。除三个其他标准基准外,我们在编译的数据集上进行了大量实验,展示了我们的方法在有监督和无监督设定下的鲁棒性与优势。此外,我们表明我们的方法能从不同视角数量的数据中集体学习,且与其他摘要方法正交,从而具有可扩展性与通用性。

关键词

引用

@article{arxiv.1812.00108,
  title  = {Multi-Stream Dynamic Video Summarization},
  author = {Mohamed Elfeki and Liqiang Wang and Ali Borji},
  journal= {arXiv preprint arXiv:1812.00108},
  year   = {2021}
}