中文

基于扩散模型的纹理保持Rendered-to-Real图像翻译:FashionR2R

计算机视觉与模式识别 2024-10-21 v1 人工智能 机器学习

摘要

建模和产生逼真的穿着人类的图像一直吸引着来自不同领域的研究者的注意力,复杂性来自高度关节和结构化的内容。渲染算法分解和模拟相机的成像过程,但受限于建模变量的准确性和计算效率。在生成模型方面,可以产生惊人逼真的人类图像,但仍缺乏可控性和可编辑性。本文研究了渲染图像的照明增强,利用扩散模型的生成能力,并在渲染的基础上进行控制。我们引入了一个新框架来将渲染图像翻译为其真实对应图像,包括两个阶段:Domain Knowledge Injection (DKI) 和 Realistic Image Generation (RIG)。在DKI中,我们采用正(真实)域微调和负(渲染)域嵌入来将知识注入到预训练的Text-to-image (T2I) 扩散模型中。在RIG中,我们生成对应于输入渲染图像的真实图像,利用UNet结构中解耦的特征编码,并引入Texture-preserving Attention Control (TAC) 以保持细粒度服装纹理。此外,我们引入了SynFashion数据集,具有多样化纹理的高质量数字服装图像。大量实验结果表明,我们的方法在渲染到真实图像翻译方面具有优势和有效性。

关键词

引用

@article{arxiv.2410.14429,
  title  = {FashionR2R: Texture-preserving Rendered-to-Real Image Translation with Diffusion Models},
  author = {Rui Hu and Qian He and Gaofeng He and Jiedong Zhuang and Huang Chen and Huafeng Liu and Huamin Wang},
  journal= {arXiv preprint arXiv:2410.14429},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024