中文

用于无监督视频摘要的掩码自编码器

计算机视觉与模式识别 2023-06-05 v1

摘要

视频摘要需要对视频有多样的理解,从识别场景到评估每帧作为摘要被选中所需的重要程度。自监督学习(SSL)以其对多种下游任务的鲁棒性和灵活性而得到认可,但视频SSL尚未在视频摘要等密集理解任务中展现其价值。我们主张,具有充分自监督学习的无监督自编码器不需要任何额外的下游架构设计或微调权重即可用作视频摘要模型。所提出的评估每帧重要性得分的方法利用了自编码器解码器的重建得分。我们在主要的无监督视频摘要基准上评估该方法,以展示其在各种实验设置下的有效性。

关键词

引用

@article{arxiv.2306.01395,
  title  = {Masked Autoencoder for Unsupervised Video Summarization},
  author = {Minho Shim and Taeoh Kim and Jinhyung Kim and Dongyoon Wee},
  journal= {arXiv preprint arXiv:2306.01395},
  year   = {2023}
}