对比损失是无监督视频摘要的自然准则
计算机视觉与模式识别
2022-11-21 v1
摘要
视频摘要旨在选取视频中信息量最大的帧子集,以便于高效浏览视频。无监督方法通常依赖多样性与代表性等启发式训练目标。然而,此类方法需以在线生成的摘要为引导来计算重要性分数回归的目标。我们认为该流程效率低下,并借助表示学习文献中的对比损失来直接量化帧级重要性。利用对比损失,我们提出刻画理想关键帧的三个指标:局部相异度、全局一致性与独特性。借助在图像分类任务上预训练的特征,这些指标已能产出高质量重要性分数,表现出与以往重度训练方法相当或更优的性能。我们展示,通过轻量级对比学习投影模块精炼预训练特征,帧级重要性分数可进一步提升,且模型能利用大量随机视频并泛化至测试视频,取得良好性能。代码见 https://github.com/pangzss/pytorch-CTVSUM。
引用
@article{arxiv.2211.10056,
title = {Contrastive Losses Are Natural Criteria for Unsupervised Video Summarization},
author = {Zongshang Pang and Yuta Nakashima and Mayu Otani and Hajime Nagahara},
journal= {arXiv preprint arXiv:2211.10056},
year = {2022}
}
备注
To appear in WACV2023