中文

自节奏与自纠正掩码预测法用于电影预告片生成

计算机视觉与模式识别 2026-03-04 v3

摘要

作为一项具有挑战性的视频编辑任务,电影预告片生成涉及选择和重组电影镜头,以创建引人入胜的预告片。目前,大多数现有的自动预告片生成方法采用“选择-排序”范式(即首先选择关键镜头,然后对其进行排序),这会导致不可避免的误差传播,并限制生成预告片的质量。超越这一范式,我们提出了一种新的自节奏和自纠正掩码预测方法,称为SSMP,通过双向上下文建模和渐进式自纠正,实现了自动预告片生成的最新成果。在此方法中,SSMP训练了一个Transformer编码器,将电影镜头序列作为提示输入,并生成相应的预告片镜头序列。该模型通过掩码预测进行训练,从其随机掩码后的版本中重建每个预告片镜头序列。掩码比例是自节奏的,这允许任务难度随模型性能的提升而自适应。在生成电影预告片时,模型在每个步骤中填充高置信度的镜头位置,并对剩余位置重新掩码,以进行下一轮预测,形成一种类似人类编辑工作方式的渐进式自纠正机制。定量结果和用户研究均表明,SSMP在与现有自动电影预告片生成方法相比具有优势。演示可在 https://github.com/Dixin-Lab/SSMP 查看。

关键词

引用

@article{arxiv.2512.04426,
  title  = {Self-Paced and Self-Corrective Masked Prediction for Movie Trailer Generation},
  author = {Sidan Zhu and Hongteng Xu and Dixin Luo},
  journal= {arXiv preprint arXiv:2512.04426},
  year   = {2026}
}