PixelWizard:面向超大空间分辨率高保真视频生成的高效框架
计算机视觉与模式识别
2026-05-26 v1
摘要
高分辨率视频生成面临优化不稳定和计算成本高昂的双重瓶颈。大量扩展的标记序列不仅偏向局部纹理而牺牲全局一致性,导致结构坍塌,还带来昂贵的训练成本和严重的推理延迟。为此,我们提出PixelWizard,通过分层解耦全局结构建模与细粒度细节合成来应对。PixelWizard首先建立紧凑的时空锚点,以集中稠密结构先验,然后指导高分辨率下的细节生成。这一机制缓解了局部优化偏置,确保结构稳定性而不牺牲高频细节。凭借这一结构稳定性,我们引入噪声跨度对齐的捷径训练以突破推理瓶颈。该机制通过显式建模步幅,允许模型以大步跨越生成轨迹。关键的是,我们引入指数索引偏置抽样和自适应噪声跨度校准,以对齐高分辨率网格的偏移噪声计划,确保少步推理而不增加强化学习的重负担。大量实验表明,PixelWizard在保持卓越视觉质量的同时,将原生2K/4K视频的生成采样加速超过10倍。
引用
@article{arxiv.2605.25801,
title = {PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution},
author = {Wenxue Li and Jingjing Ren and Peng Zhang and Tian Ye and Daiguo Zhou and Jian Luan and Lei Zhu},
journal= {arXiv preprint arXiv:2605.25801},
year = {2026}
}