中文

HyperStyle3D:基于超网络的文本引导三维肖像风格化

计算机视觉与模式识别 2023-04-20 v1

摘要

肖像风格化是一项长期存在的任务,具有广泛的应用。尽管基于 2D 的方法近年来取得了巨大进展,但元宇宙和游戏等现实世界应用通常需要 3D 内容。另一方面,3D 数据的获取成本高昂,这一需求严重阻碍了 3D 肖像风格化方法的发展。在本文中,受 3D 感知 GAN 成功地将 2D 与 3D 领域以 3D 场作为渲染 2D 图像的中间表示的启发,我们提出了一种基于 3D 感知 GAN 的用于 3D 肖像风格化的新方法,称为 HyperStyle3D。我们方法的核心是一个学习到的超网络(hyper-network),用于在单次前向传播中操控生成器的参数。它不仅提供了以单一模型处理多种风格的强大能力,还实现了仅影响纹理、形状或肖像局部部分的灵活细粒度风格化。虽然使用 3D 感知 GAN 规避了 3D 数据的需求,我们进一步利用 CLIP 模型作为风格化引导,减轻了风格图像的必要。我们在风格、属性和形状上进行了大量实验,同时测量了 3D 一致性。这些实验证明了我们的 HyperStyle3D 模型在渲染多样风格的 3D 一致图像、变形人脸形状以及编辑各种属性方面的优越能力。

关键词

引用

@article{arxiv.2304.09463,
  title  = {HyperStyle3D: Text-Guided 3D Portrait Stylization via Hypernetworks},
  author = {Zhuo Chen and Xudong Xu and Yichao Yan and Ye Pan and Wenhan Zhu and Wayne Wu and Bo Dai and Xiaokang Yang},
  journal= {arXiv preprint arXiv:2304.09463},
  year   = {2023}
}