中文

TextGaze:基于自然语言的视线可控人脸生成

计算机视觉与模式识别 2024-10-01 v3

摘要

生成具有特定视线信息的人脸图像引起了广泛关注。现有方法通常直接输入视线值进行人脸生成,这既不自然又需要带标注的视线数据集进行训练,从而限制了其应用。在本文中,我们提出了一项新颖的视线可控人脸生成任务。我们的方法输入描述人类视线和头部行为的文本描述,并生成相应的人脸图像。我们的工作首次引入了一个视线文本数据集,包含超过 9 万条文本描述,涵盖了密集分布的视线和头部姿态。我们进一步提出了一种视线可控的文本到人脸方法。我们的方法包含一个草图条件人脸扩散模块和一个基于模型的草图扩散模块。我们基于面部关键点和眼睛分割图定义了人脸草图。人脸扩散模块从人脸草图生成人脸图像,而草图扩散模块利用 3D 人脸模型从文本描述生成人脸草图。在 FFHQ 数据集上的实验表明了我们方法的有效性。我们将为未来的研究发布我们的数据集和代码。

关键词

引用

@article{arxiv.2404.17486,
  title  = {TextGaze: Gaze-Controllable Face Generation with Natural Language},
  author = {Hengfei Wang and Zhongqun Zhang and Yihua Cheng and Hyung Jin Chang},
  journal= {arXiv preprint arXiv:2404.17486},
  year   = {2024}
}

备注

ACM MM2024