中文

SELF-VS:用于视频摘要的自监督编码学习

计算机视觉与模式识别 2023-03-29 v1

摘要

尽管应用广泛,视频摘要仍受限于大规模数据集的匮乏,这主要源于帧级标注的费力和昂贵。因此,现有视频摘要方法容易过拟合。为缓解这一挑战,我们提出一种新颖的自监督视频表示学习方法,利用知识蒸馏预训练一个 transformer 编码器。我们的方法将其依据帧重要性分数构建的语义视频表示,与从在视频分类上训练的 CNN 导出的表示相匹配。基于相关性指标(如 Kendall 的 τ\tau 和 Spearman 的 ρ\rho)的实证评估表明,相较于现有的最先进方法,我们的方法在为输入帧分配相对分数方面具有优越性。

关键词

引用

@article{arxiv.2303.15993,
  title  = {SELF-VS: Self-supervised Encoding Learning For Video Summarization},
  author = {Hojjat Mokhtarabadi and Kave Bahraman and Mehrdad HosseinZadeh and Mahdi Eftekhari},
  journal= {arXiv preprint arXiv:2303.15993},
  year   = {2023}
}

备注

9 pages, 5 figures