保持一致性的多样化视频生成
计算机视觉与模式识别
2026-02-18 v1
摘要
文本到视频生成成本高昂,通常仅能为每个提示生成少量样本。在低样本 regime 下,最大化每个 batch 的价值需要实现高跨视频多样性。近期方法在图像生成中改善了多样性,但视频生成时常会损害视频内部的时间一致性,且需要昂贵的反向传播穿过视频解码器。我们提出一种用于流匹配视频生成器的联合抽样框架,在提高 batch 多样性的同时保持时间一致性。该方法应用多样性驱动的更新,然后仅移除将降低时间一致性目标的组件。为避免图像空间梯度,我们使用轻量级潜空间模型计算两个目标,避免视频解码和解码器反向传播。在来自最新文本到视频流匹配模型的实验中,我们的方法在保持强大的联合抽样基准多样性的同时,显著改善了时间一致性和颜色自然度。代码将公开释放。
引用
@article{arxiv.2602.15287,
title = {Consistency-Preserving Diverse Video Generation},
author = {Xinshuang Liu and Runfa Blark Li and Truong Nguyen},
journal= {arXiv preprint arXiv:2602.15287},
year = {2026}
}