中文

通过同步耦合采样实现无调参的多事件长视频生成

计算机视觉与模式识别 2025-03-12 v1 人工智能 机器学习

摘要

尽管近期文本到视频扩散模型的进展使得从单一提示生成高质量短视频成为可能,但在单次传递中生成真实世界的长视频仍然具有挑战性,原因是数据有限且计算成本高。为解决这一问题,若干工作提出了无调参方法,即扩展现有模型以生成长视频,具体使用多个提示以允许动态和受控的内容变化。然而,这些方法主要关注确保相邻帧之间的平滑过渡,往往导致内容漂移和较长序列中语义一致性的逐渐丧失。为解决此类问题,我们提出了同步耦合采样 (SynCoS),一种新颖的推理框架,它在整个视频范围内同步去噪路径,确保相邻帧和远距离帧之间的长程一致性。我们的方法结合了两种互补的采样策略:反向采样和基于优化的采样,分别确保无缝的局部过渡和强制全局一致性。然而,直接在这两种采样之间交替会导致去噪轨迹错位,破坏提示引导并引入意外的内容变化,因为它们独立运行。为解决这一问题,SynCoS 通过一个锚定时间步和一个固定基线噪声对它们进行同步,确保完全耦合的采样与对齐的去噪路径。大量实验表明,SynCoS 显著提升了多事件长视频生成,实现了更平滑的过渡和优越的长程一致性,在定量和定性方面均优于先前方法。

关键词

引用

@article{arxiv.2503.08605,
  title  = {Tuning-Free Multi-Event Long Video Generation via Synchronized Coupled Sampling},
  author = {Subin Kim and Seoung Wug Oh and Jui-Hsien Wang and Joon-Young Lee and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2503.08605},
  year   = {2025}
}

备注

Project page with visuals: https://syncos2025.github.io/