中文

StyleDiT:基于风格隐扩散Transformer的多样化儿童与伴侣面孔合成统一框架

计算机视觉与模式识别 2024-12-17 v1

摘要

由于可用亲属数据的稀缺性和低质量,亲属面孔合成是一项具有挑战性的问题。现有方法通常难以在精确控制年龄和性别等面部属性的同时,生成兼具高多样性和高保真度的后代。为了解决这些问题,我们提出了风格隐扩散Transformer(StyleDiT),这是一种将 StyleGAN 的优势与扩散模型相结合以生成高质量和多样化亲属面孔的新颖框架。在该框架中,StyleGAN 丰富的面部先验实现了细粒度的属性控制,而我们的条件扩散模型则利用建模复杂亲属关系分布的优势,用于采样与条件图像亲属关系相匹配的 StyleGAN 隐变量。随后,StyleGAN 处理隐变量解码以生成最终面孔。此外,我们引入了关系特征引导(RTG)机制,实现了对每个父母面部图像等影响条件的独立控制。RTG 还能够在合成面孔的多样性与保真度之间进行细粒度调整。进一步地,我们将该应用扩展至一个未探索的领域:在同一框架内,利用儿童图像和单亲图像预测伴侣的面部图像。大量实验表明,我们的 StyleDiT 在生成多样化和高保真亲属面孔之间取得了出色的平衡,优于现有方法。

关键词

引用

@article{arxiv.2412.10785,
  title  = {StyleDiT: A Unified Framework for Diverse Child and Partner Faces Synthesis with Style Latent Diffusion Transformer},
  author = {Pin-Yen Chiu and Dai-Jie Wu and Po-Hsun Chu and Chia-Hsuan Hsu and Hsiang-Chen Chiu and Chih-Yu Wang and Jun-Cheng Chen},
  journal= {arXiv preprint arXiv:2412.10785},
  year   = {2024}
}