中文

3DreamBooth:高保真 3D 主体驱动视频生成模型

计算机视觉与模式识别 2026-03-20 v1

摘要

创建具有动态、视角一致性的定制化主体视频高度受欢迎,适用于包括沉浸式 VR/AR、虚拟制作和下一代电商在内的广泛新兴应用。然而,尽管主体驱动视频生成领域取得了快速进展,现有方法主要将主体视为二维实体,专注于通过单视图视觉特征或文本提示传递身份特征。由于现实世界主体本质上是三维的,将这些二维中心方法应用于 3D 对象定制暴露了根本性局限:它们缺乏重建 3D 几何结构所必需的全面空间先验。因此,在合成新视角时,它们必须依赖生成 plausible 但任意的细节来填补不可见区域,而非保留真实的 3D 身份。实现真正的 3D 定制化仍具挑战性,这源于多视角视频数据稀缺。虽然可能尝试在有限的视频序列上进行微调,但这往往导致时序过拟合。为解决此问题,我们引入一种新型的 3D 定制化视频框架,包含 3DreamBooth 和 3Dapter。3DreamBooth 通过单帧优化范式将空间几何与时间运动解耦。通过限制更新空间表征,有效地在无需详尽视频训练的情况下将稳健的 3D 先验烘焙到模型中。为增强细粒度纹理并加速收敛,我们引入 3Dapter,一个视觉条件模块。遵循单视图预训练后,3Dapter 通过非对称条件策略在主生成分支上进行多视角联合优化。这种设计允许该模块作为动态选择路由器,从最小参考集查询特定视角的几何线索。项目页面:https://ko-lani.github.io/3DreamBooth/

关键词

引用

@article{arxiv.2603.18524,
  title  = {3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model},
  author = {Hyun-kyu Ko and Jihyeon Park and Younghyun Kim and Dongheok Park and Eunbyung Park},
  journal= {arXiv preprint arXiv:2603.18524},
  year   = {2026}
}

备注

Project page: https://ko-lani.github.io/3DreamBooth Code: https://github.com/Ko-Lani/3DreamBooth