通过对比片段学习视频摘要
计算机视觉与模式识别
2023-04-20 v3
摘要
视频摘要旨在选择视频中尽可能接近原始故事叙述的部分。现有的大多数视频摘要方法都侧重于手工标注的标签。随着视频数量呈指数级增长,越来越需要能够在没有标注注释的情况下学习有意义摘要的方法。在本文中,我们旨在最大限度地利用无监督视频摘要,同时将监督集中到少数个性化标签上作为补充。为此,我们制定了信息性视频摘要的关键要求。然后,我们提出对比学习作为这两个问题的答案。为了进一步提升对比视频摘要(CSUM)的性能,我们提出对比 top-k 特征,而不是现有方法采用的均值视频特征,并通过一个可微的 top-k 特征选择器来实现。我们在多个基准数据集上的实验表明,我们的方法在没有提供标注数据时,能够生成有意义且多样化的摘要。
引用
@article{arxiv.2301.05213,
title = {Learning to Summarize Videos by Contrasting Clips},
author = {Ivan Sosnovik and Artem Moskalev and Cees Kaandorp and Arnold Smeulders},
journal= {arXiv preprint arXiv:2301.05213},
year = {2023}
}