通过后训练提升视频生成中场景转换 awareness
计算机视觉与模式识别
2026-02-03 v1 人工智能
摘要
近期 AI 生成视频在文本到视频任务上表现突出,尤其擅长生成单场景短片。然而当前模型难以生成具备连贯场景转换的长视频,主要因无法从提示词中推断何时需要场景转换。大多数开源模型训练数据由单场景视频片段构成,限制了其学习和响应多场景提示的能力。发展场景转换 awareness 对多场景生成至关重要,因为它使模型能够识别并将视频分割为具有准确过渡检测的独特片段。为此,我们提出了包含多个场景转换预处理视频片段的 \textbf{Transition-Aware Video} (TAV) 数据集。实验表明,对 TAV 数据集进行后训练可改善提示词驱动的场景转换理解,缩小所需场景与生成场景之间的差距,同时保持图像质量。
引用
@article{arxiv.2507.18046,
title = {Enhancing Scene Transition Awareness in Video Generation via Post-Training},
author = {Hanwen Shen and Jiajie Lu and Yupeng Cao and Xiaonan Yang},
journal= {arXiv preprint arXiv:2507.18046},
year = {2026}
}