中文

语义文本到人脸 GAN——ST^2FG

计算机视觉与模式识别 2023-12-14 v4 机器学习

摘要

使用生成对抗网络(GANs)生成的人脸已达到前所未有的真实感。这些人脸也被称为“深度伪造”(Deep Fakes),表现为具有极少像素级失真的真实照片。尽管已有一些工作能够训练产生特定主体属性的模型,但基于自然语言描述生成人脸图像尚未被充分探索。对于安全和罪犯识别而言,提供一种像素描艺术家一样工作的基于 GAN 的系统将非常有用。在本文中,我们提出了一种从语义文本描述生成人脸图像的新方法。所学模型获得文本描述和人脸类型轮廓,模型据此勾勒特征。我们的模型使用仿射组合模块(ACM)机制,通过自注意力矩阵将来自 BERT 的文本嵌入与 GAN 潜空间相结合。这避免了因“注意力”不足而导致的特征丢失,而若简单拼接文本嵌入与潜向量则可能发生此类丢失。我们的方法能够生成与详尽人脸文本描述高度对齐的图像,包含许多人脸精细细节特征,并有助于生成更好的图像。所提方法还能够在给定额外文本描述或句子时,对先前生成的图像进行增量修改。

关键词

引用

@article{arxiv.2107.10756,
  title  = {Semantic Text-to-Face GAN -ST^2FG},
  author = {Manan Oza and Sukalpa Chanda and David Doermann},
  journal= {arXiv preprint arXiv:2107.10756},
  year   = {2023}
}

备注

Experiments needs to be redone