中文

LUVE:基于双频率专家的潜在级联超高分辨率视频生成框架

计算机视觉与模式识别 2026-05-28 v2

摘要

近期视频扩散模型的进展显著提高了视觉质量,但超高分辨率(UHR)视频生成仍是一个巨大的挑战,主要由于运动建模、语义规划和细节合成的复合难题。为此,我们提出了LUVE,一个基于双频率专家构建的L**U**ltra-H**V**ideo generation框架。LUVE采用三阶段体系结构:包括用于运动一致性潜在合成的低分辨率运动生成、直接在潜在空间执行分辨率上采样以缓解内存和计算开销的视频潜在上采样,以及集成低频和高频专家以协同增强语义连贯性和细粒度细节生成的高分辨率内容细化。广泛的实验结果表明,LUVE在UHR视频生成中实现了卓越的照片 realism和内容忠实度,综合的消融研究进一步验证了每个组件的有效性。该项目可在https://github.io/LUVE/访问。

关键词

引用

@article{arxiv.2602.11564,
  title  = {LUVE : Latent-Cascaded Ultra-High-Resolution Video Generation with Dual Frequency Experts},
  author = {Chen Zhao and Jiawei Chen and Hongyu Li and Zhuoliang Kang and Shilin Lu and Xiaoming Wei and Kai Zhang and Jian Yang and Ying Tai},
  journal= {arXiv preprint arXiv:2602.11564},
  year   = {2026}
}

备注

ICML 2026