AtlasVid:基于解耦全局-局部建模的高效超高分辨率长视频生成
计算机视觉与模式识别
2026-05-19 v1
摘要
近期基于扩散的视频生成器已实现卓越的视觉保真度和提示可控性,但将其扩展到超高分辨率 (UHR) 长视频仍显得代价高昂。特别是在需要保持连续场景全局时序一致性、同时保留细粒度空间细节且不依赖剪辑转换或自回归镜头拼接的情况下,难度尤为突出。本文从解耦建模的视角重新审视这一挑战。我们认为现有视频扩散模型已编码出强大的局部视觉先验,而主要瓶颈在于高效扩展全局时空建模以适应分辨率和持续时间的增加。基于此洞见,我们提出了AtlaVid,这是一种用于高效 UHR 长视频生成的解耦全局-局部分支框架。AtlaVid 首先通过时序比例 RoPE 生成低分辨率低帧率的全局语义代理,从而在不增加训练标记数量的前提下扩展时序视野。以该代理为指导,高分辨率细节分支执行联合去噪并采用分层保持局部性的注意力。重排后的时空窗口保持几何局部性,while 非对称全局-局部注意力注入对齐语义指导并保留模型的预训练能力。此设计使模型能够进行分辨率无关训练:模型仅在 720P 上进行轻量级 LoRA 适配训练,却能直接推理生成超过 4K 分辨率且时长超过 10 秒的视频。实验表明,AtlaVid 在超高分辨率长视频生成中显著提升了效率,以 60.9 倍的速度实现高质量 UHR 长视频生成,训练成本更低,甚至性能优于本地 4K 视频生成器。
引用
@article{arxiv.2605.16649,
title = {AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling},
author = {Ziyang Mai and Yuyao Zhang and Yu-Wing Tai},
journal= {arXiv preprint arXiv:2605.16649},
year = {2026}
}