基于分布上分数蒸馏采样的高效文本引导三维感知肖像生成
计算机视觉与模式识别
2023-06-06 v1
摘要
文本到三维(Text-to-3D)是一项新兴任务,允许用户以无限可能创建三维内容。现有工作通过用预训练扩散模型的引导优化三维表示来解决该问题。一个明显的缺陷是它们需要针对每个提示从头优化,计算开销大且常导致视觉保真度差。本文提出 DreamPortrait,旨在以单次前向传播生成文本引导的三维感知肖像以提升效率。为此,我们将分数蒸馏采样(Score Distillation Sampling)从数据点推广至分布形式,将语义先验注入三维分布。然而,直接推广会因目标仅追求语义对齐而导致模式崩溃问题。因此,我们提出用分层条件适配器与 GAN 损失正则化来优化一个分布。为更好的三维建模,我们进一步设计了一种三维感知门控交叉注意力机制,显式让模型感知文本与三维感知空间之间的对应关系。这些精细设计使我们的模型能生成具有鲁棒多视角语义一致性的肖像,免除了基于优化的方法之需。大量实验证明了我们的模型相较现有方法极具竞争力的性能与显著的速度提升。
引用
@article{arxiv.2306.02083,
title = {Efficient Text-Guided 3D-Aware Portrait Generation with Score Distillation Sampling on Distribution},
author = {Yiji Cheng and Fei Yin and Xiaoke Huang and Xintong Yu and Jiaxiang Liu and Shikun Feng and Yujiu Yang and Yansong Tang},
journal= {arXiv preprint arXiv:2306.02083},
year = {2023}
}