中文

DiffusionBrowser:通过多分支解码器实现交互式扩散预览

计算机视觉与模式识别 2025-12-16 v1 人工智能 图形学 机器学习

摘要

视频扩散模型革新了生成式视频合成,但它们在生成过程中不精确、缓慢且不透明——使用户长期处于未知状态。在本工作中,我们提出DiffusionBrowser,一个模型无关的轻量级解码器框架,允许用户在去噪过程中的任意时刻(时间步或变换器块)交互式地生成预览。我们的模型能够生成多模态预览表示,包括RGB和场景内禀属性,以超过4倍实时速度(4秒视频不到1秒)生成,传达与最终视频一致的外观和运动。利用训练好的解码器,我们展示了可以通过随机性再注入和模态引导在中间噪声步骤交互式地引导生成,从而解锁新的控制能力。此外,我们使用学习到的解码器系统地探测模型,揭示了场景、物体和其他细节在原本黑箱式的去噪过程中是如何组合和组装的。

关键词

引用

@article{arxiv.2512.13690,
  title  = {DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders},
  author = {Susung Hong and Chongjian Ge and Zhifei Zhang and Jui-Hsien Wang},
  journal= {arXiv preprint arXiv:2512.13690},
  year   = {2025}
}

备注

Project page: https://susunghong.github.io/DiffusionBrowser