语义文本到人脸 GAN——ST^2FG
计算机视觉与模式识别
2023-12-14 v4 机器学习
摘要
使用生成对抗网络(GANs)生成的人脸已达到前所未有的真实感。这些人脸也被称为“深度伪造”(Deep Fakes),表现为具有极少像素级失真的真实照片。尽管已有一些工作能够训练产生特定主体属性的模型,但基于自然语言描述生成人脸图像尚未被充分探索。对于安全和罪犯识别而言,提供一种像素描艺术家一样工作的基于 GAN 的系统将非常有用。在本文中,我们提出了一种从语义文本描述生成人脸图像的新方法。所学模型获得文本描述和人脸类型轮廓,模型据此勾勒特征。我们的模型使用仿射组合模块(ACM)机制,通过自注意力矩阵将来自 BERT 的文本嵌入与 GAN 潜空间相结合。这避免了因“注意力”不足而导致的特征丢失,而若简单拼接文本嵌入与潜向量则可能发生此类丢失。我们的方法能够生成与详尽人脸文本描述高度对齐的图像,包含许多人脸精细细节特征,并有助于生成更好的图像。所提方法还能够在给定额外文本描述或句子时,对先前生成的图像进行增量修改。
引用
@article{arxiv.2107.10756,
title = {Semantic Text-to-Face GAN -ST^2FG},
author = {Manan Oza and Sukalpa Chanda and David Doermann},
journal= {arXiv preprint arXiv:2107.10756},
year = {2023}
}
备注
Experiments needs to be redone