中文

通过 VISIOCITY 实现真实视频摘要:一种新基准与评估框架

计算机视觉与模式识别 2020-08-26 v2 信息检索 机器学习 多媒体

摘要

自动视频摘要由于若干挑战仍是一个未解决的问题。我们通过应对这些挑战,朝着使自动视频摘要更贴近现实迈进。首先,现有可用数据集要么视频极短,要么仅有少数特定类型的长视频。我们引入了一个新的基准数据集 VISIOCITY,其包含跨越六个不同类别的较长视频,具有稠密概念标注,能够支持不同形式的视频摘要并可用于其他视觉问题。其次,对于长视频,难以获取人类参考摘要。我们提出了一种基于帕累托最优的新方法,从 VISIOCITY 中存在的间接真值自动生成多个参考摘要。我们表明这些摘要与人类摘要相当。第三,我们论证了在存在多个真值摘要(由于该任务高度主观的性质)时,使用单一损失函数从单一组合真值摘要学习并非良策。我们提出了一个简单方法 VISIOCITY-SUM,通过组合损失来增强现有模型,并证明其在 VISIOCITY 上测试时击败了当前最先进技术。我们还表明,如当前典型做法那样使用单一指标评估摘要是不够的。我们提出了一种更好的摘要质量定量评估框架,其比单一指标(如 F1)更接近人类判断。我们报告了若干代表性视频摘要技术在 VISIOCITY 上经多种指标评估的性能,并揭示这些技术和/或评估机制在建模人类判断上的局限,同时展示了我们的评估框架在其中的有效性。

关键词

引用

@article{arxiv.2007.14560,
  title  = {Realistic Video Summarization through VISIOCITY: A New Benchmark and Evaluation Framework},
  author = {Vishal Kaushal and Suraj Kothawade and Rishabh Iyer and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2007.14560},
  year   = {2020}
}

备注

19 pages, 1 figure, 14 tables