中文

基于可控自编码器从声音生成人脸

计算机视觉与模式识别 2021-07-19 v1 机器学习 声音 音频与语音处理 图像与视频处理

摘要

过去多项研究表明,人类声音特征与面部特征之间存在强相关性。然而,现有方法仅从声音简单生成人脸,而未探究导致这些观测相关性的特征集合。可通过将问题重新表述为:“目标人脸需要改变多少才能被视为某源声音的发出来重构这一问题的计算方法论:”为此,本文提出一种框架,根据给定的声音对目标人脸进行形变,使面部特征由学习到的声音-人脸相关性隐式引导。我们的框架包含一个引导式自编码器,可将一张人脸转换为另一张,并由一个称为门控控制器的独特模型条件组件控制,该组件基于输入语音录音修改重建的人脸。我们通过人类受试者和人脸检索在 VoxCelab 和 VGGFace 数据集上评估该框架。多种实验证明了我们提出模型的有效性。

关键词

引用

@article{arxiv.2107.07988,
  title  = {Controlled AutoEncoders to Generate Faces from Voices},
  author = {Hao Liang and Lulan Yu and Guikang Xu and Bhiksha Raj and Rita Singh},
  journal= {arXiv preprint arXiv:2107.07988},
  year   = {2021}
}