中文

Control-DINO:用于可控图像到视频扩散的特征空间条件化

计算机视觉与模式识别 2026-04-03 v1

摘要

视频模型最近已成功应用于内容生成、新视角合成以及更广泛的世界模拟等领域。生成和迁移中的许多应用依赖于对这些模型的条件化,通常通过感知、几何或简单的语义信号,本质上将其用作生成渲染器。与此同时,通过大规模自监督学习从图像或点云中获得的高维特征正日益被用作视觉模型的通用接口。两者之间的联系已在特定主体编辑、对齐和训练视频扩散模型方面得到探索,但尚未作为更通用的条件化信号用于预训练的视频扩散模型。通过自监督学习(如 DINO)获得的特征包含大量关于场景风格、光照和语义的纠缠信息。这使它们非常适合重建任务,但限制了其生成能力。在本文中,我们展示了如何将这些特征用于视频域迁移和从 3D 生成视频等任务。我们提出了一种轻量级架构和训练策略,将外观与其他我们希望保留的特征解耦,从而实现对外观变化(如风格化和重光照)的鲁棒控制。此外,我们表明低空间分辨率可以通过更高的特征维度来补偿,从而提高从显式空间表示进行生成渲染的可控性。

关键词

引用

@article{arxiv.2604.01761,
  title  = {Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion},
  author = {Edoardo A. Dominici and Thomas Deixelberger and Konstantinos Vardis and Markus Steinberger},
  journal= {arXiv preprint arXiv:2604.01761},
  year   = {2026}
}

备注

project page https://dedoardo.github.io/projects/control-dino/