作为着色器的扩散:面向灵活视频生成控制的 3D 视频扩散
计算机视觉与模式识别
2025-01-10 v2 人工智能
图形学
摘要
扩散模型在从文本提示或图像生成高质量视频方面已显示出惊人的性能。然而,对视频生成过程进行精确控制(如相机操控或内容编辑)仍是一个显著挑战。现有方法通常仅限于单一控制类型,缺乏处理多样化控制需求的灵活性。本文提出了一种新方法——Diffusion as Shader (DaS),在统一的架构中支持多种视频控制任务。我们的关键洞察是,实现灵活的视频控制需要利用 3D 控制信号,因为视频本质上是动态 3D 内容的 2D 渲染。不同于以往仅限于 2D 控制信号的方法,DaS 利用 3D 跟踪视频作为控制输入,使视频扩散过程具备内在的 3D 感知。这种创新允许 DaS 通过简单地操控 3D 跟踪视频实现广泛的视频控制,包括网格到视频生成、相机控制、运动迁移和对象操控。使用 3D 跟踪视频的另一优势是有效地将帧链接起来,显著增强生成视频的时序一致性。在使用不足 1 万个视频和 8 块 H800 GPU 进行 3 天微调后,DaS 在 diverse 任务上展现出强大的控制能力。
引用
@article{arxiv.2501.03847,
title = {Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control},
author = {Zekai Gu and Rui Yan and Jiahao Lu and Peng Li and Zhiyang Dou and Chenyang Si and Zhen Dong and Qifeng Liu and Cheng Lin and Ziwei Liu and Wenping Wang and Yuan Liu},
journal= {arXiv preprint arXiv:2501.03847},
year = {2025}
}
备注
Project page: https://igl-hkust.github.io/das/ Codes: https://github.com/IGL-HKUST/DiffusionAsShader