4D-fy:基于混合分数蒸馏采样的文本到 4D 生成
计算机视觉与模式识别
2024-05-28 v2
摘要
近期文本到 4D 生成的突破依赖于预训练的文本到图像与文本到视频模型来生成动态 3D 场景。然而,当前文本到 4D 方法在场景外观质量、3D 结构与运动之间面临三方权衡。例如,文本到图像模型及其 3D 感知变体在互联网规模图像数据集上训练,可用于生成具有真实外观与 3D 结构的场景——但无运动。文本到视频模型在相对较小的视频数据集上训练,可生成有运动的场景,但外观与 3D 结构较差。尽管这些模型优势互补,却也劣势对立,难以以缓解此三方权衡的方式结合。本文引入混合分数蒸馏采样,一种交替优化过程,融合多个预训练扩散模型的监督信号,兼顾各自优势以实现高保真文本到 4D 生成。利用混合 SDS,我们展示了具有引人注目外观、3D 结构与运动的 4D 场景合成。
引用
@article{arxiv.2311.17984,
title = {4D-fy: Text-to-4D Generation Using Hybrid Score Distillation Sampling},
author = {Sherwin Bahmani and Ivan Skorokhodov and Victor Rong and Gordon Wetzstein and Leonidas Guibas and Peter Wonka and Sergey Tulyakov and Jeong Joon Park and Andrea Tagliasacchi and David B. Lindell},
journal= {arXiv preprint arXiv:2311.17984},
year = {2024}
}
备注
CVPR 2024; Project page: https://sherwinbahmani.github.io/4dfy