视频摘要质量几何?面向真实视频摘要的新基准数据集与评估框架
计算机视觉与模式识别
2021-01-27 v1 多媒体
摘要
由于若干挑战,自动视频摘要仍是一个未解决的问题。当前可用的数据集要么视频很短,要么仅有少数特定类型的长视频。我们引入一个名为 VISIOCITY(基于连续性、意图与多样性的视频摘要,VIdeo SummarIzatiOn based on Continuity, Intent and DiversiTY)的新基准视频数据集,其包含跨越六个不同类别的较长视频,并带有稠密概念标注,能够支持不同形式的视频摘要及其他视觉问题。对于长视频,监督式视频摘要技术所需的人类参考摘要难以获取。我们探索了从 VISIOCITY 中存在的间接真值自动生成多个参考摘要的策略。我们表明这些摘要与人类摘要相当。我们还呈现了一项关于良好摘要不同期望特性的研究,并论证具有不同特性的两个良好摘要并存是正常现象。因此我们主张,将摘要与一个或多个人类摘要比对并使用单一度量进行评估有其缺陷。我们提出了一种更贴近人类判断、用于更好定量评估摘要质量的评估框架。最后,我们给出了关于如何增强模型以产出更好摘要的见解。具体而言,当可存在多个多样化真值摘要时,分别从它们学习并使用衡量不同特性的损失函数组合,优于从单一组合(oracle)真值摘要以单一损失函数学习。我们展示了相较于在 VISIOCITY 上测试的一些代表性 SOTA 技术,此举的有效性。我们将 VISIOCITY 作为基准数据集发布,并邀请研究者在 VISIOCITY 上测试其视频摘要算法的有效性。
引用
@article{arxiv.2101.10514,
title = {How Good is a Video Summary? A New Benchmarking Dataset and Evaluation Framework Towards Realistic Video Summarization},
author = {Vishal Kaushal and Suraj Kothawade and Anshul Tomar and Rishabh Iyer and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2101.10514},
year = {2021}
}
备注
19 pages, 6 tables, 4 figures. arXiv admin note: substantial text overlap with arXiv:2007.14560