中文

对比损失是无监督视频摘要的自然准则

计算机视觉与模式识别 2022-11-21 v1

摘要

视频摘要旨在选取视频中信息量最大的帧子集,以便于高效浏览视频。无监督方法通常依赖多样性与代表性等启发式训练目标。然而,此类方法需以在线生成的摘要为引导来计算重要性分数回归的目标。我们认为该流程效率低下,并借助表示学习文献中的对比损失来直接量化帧级重要性。利用对比损失,我们提出刻画理想关键帧的三个指标:局部相异度、全局一致性与独特性。借助在图像分类任务上预训练的特征,这些指标已能产出高质量重要性分数,表现出与以往重度训练方法相当或更优的性能。我们展示,通过轻量级对比学习投影模块精炼预训练特征,帧级重要性分数可进一步提升,且模型能利用大量随机视频并泛化至测试视频,取得良好性能。代码见 https://github.com/pangzss/pytorch-CTVSUM。

关键词

引用

@article{arxiv.2211.10056,
  title  = {Contrastive Losses Are Natural Criteria for Unsupervised Video Summarization},
  author = {Zongshang Pang and Yuta Nakashima and Mayu Otani and Hajime Nagahara},
  journal= {arXiv preprint arXiv:2211.10056},
  year   = {2022}
}

备注

To appear in WACV2023