为实时自回归视频扩散适配 VACE
计算机视觉与模式识别
2026-02-17 v1 人工智能
摘要
我们描述了将 VACE(Video All-in-one Creation and Editing)适用于实时自回归视频生成的改造方案。VACE 提供了统一的视频控制功能(参考指导、结构条件、填充和时间扩展),但假设对完整序列进行双向注意力,这使其与需要固定块大小和因果注意力的流式管道不兼容。关键修改将参考帧从扩散潜空间移动到平行的条件路径,从而保留自回归模型所需的固定块大小和 KV 缓存。该改造无需额外训练即可复用现有的预训练 VACE 权重。在 13B 和 14B 模型规模下,VACE 对于结构控制和填充增加了 20-30% 的延迟开销,但相对于基础模型的 VRAM 开销极小。由于因果注意力的限制,参考图到视频的保真度严重降低。参考实现已发布于 https://github.com/daydreamlive/scope。
引用
@article{arxiv.2602.14381,
title = {Adapting VACE for Real-Time Autoregressive Video Diffusion},
author = {Ryan Fosdick},
journal= {arXiv preprint arXiv:2602.14381},
year = {2026}
}
备注
10 pages, 4 figures, 7 tables