SELF-VS:用于视频摘要的自监督编码学习
计算机视觉与模式识别
2023-03-29 v1
摘要
尽管应用广泛,视频摘要仍受限于大规模数据集的匮乏,这主要源于帧级标注的费力和昂贵。因此,现有视频摘要方法容易过拟合。为缓解这一挑战,我们提出一种新颖的自监督视频表示学习方法,利用知识蒸馏预训练一个 transformer 编码器。我们的方法将其依据帧重要性分数构建的语义视频表示,与从在视频分类上训练的 CNN 导出的表示相匹配。基于相关性指标(如 Kendall 的 和 Spearman 的 )的实证评估表明,相较于现有的最先进方法,我们的方法在为输入帧分配相对分数方面具有优越性。
引用
@article{arxiv.2303.15993,
title = {SELF-VS: Self-supervised Encoding Learning For Video Summarization},
author = {Hojjat Mokhtarabadi and Kave Bahraman and Mehrdad HosseinZadeh and Mahdi Eftekhari},
journal= {arXiv preprint arXiv:2303.15993},
year = {2023}
}
备注
9 pages, 5 figures