中文

无需调参提升长视频生成一致性

计算机视觉与模式识别 2025-07-08 v2 人工智能 机器学习

摘要

尽管在长视频生成问题上取得了显著进展,但在生成视频的平滑性和场景之间转换的一致性方面仍有很大的提升空间。我们针对这些问题增强了使用单一或多个提示生成视频的一致性和连贯性。我们提出了基于时间频率的temporal Attention重加权算法(TiARA),该方法基于离散短时傅里叶变换(DFT)谨慎编辑注意力得分矩阵。该方法由基于频率的分析所支持,确保编辑后的注意力得分矩阵在帧之间实现改进的一致性。这一方法在视频扩散模型中首次引入频率方法。对于由多个提示生成的视频,我们进一步发现影响提示插值质量的关键因素,如提示间的对齐。鼓励我们的分析,我们提出了PromptBlend,一种高级提示插值管道,系统性地对齐提示。大量实验结果验证了我们方法的有效性,显示与多个基线方法相比,一致性显著提高。

关键词

引用

@article{arxiv.2412.17254,
  title  = {Enhancing Long Video Generation Consistency without Tuning},
  author = {Xingyao Li and Fengzhuo Zhang and Jiachun Pan and Yunlong Hou and Vincent Y. F. Tan and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2412.17254},
  year   = {2025}
}

备注

ICML 2025 Workshop on Building Physically Plausible World Models (Best Paper), 32 pages, 17 figures