中文

从大型视觉语言模型中解耦3D以实现可控肖像生成

计算机视觉与模式识别 2025-06-18 v1

摘要

我们考虑从大型视觉语言模型中解耦3D的问题,并在生成式3D肖像上展示。这允许对年龄、发型和眼镜等外观属性进行自由形式的文本控制,以及对面部表情和相机姿态进行3D几何控制。在此设置中,我们假设使用预训练的大型视觉语言模型(LVLM;CLIP)从一个较小的2D数据集生成,无需额外的配对标签,并使用预定义的3D可变形模型(FLAME)。首先,我们通过从可变形神经3D三平面表示到2D参考帧的规范化来进行解耦。但另一种形式的纠缠源于LVLM嵌入空间中描述无关特征的显著噪声。这会损害输出质量和多样性,但我们通过一种可以使用随机近似器高效计算的雅可比正则化克服了这一点。与现有方法相比,我们的方法生成的肖像具有额外的文本和3D控制,当任一控制改变时,肖像保持一致。广义上,这种方法允许创作者在他们自己的2D面部数据上控制3D生成器,而无需标记大量数据或训练大型模型的资源。

关键词

引用

@article{arxiv.2506.14015,
  title  = {Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation},
  author = {Nick Yiwen Huang and Akin Caliskan and Berkay Kicanaoglu and James Tompkin and Hyeongwoo Kim},
  journal= {arXiv preprint arXiv:2506.14015},
  year   = {2025}
}