中文

从声音重建人脸

声音 2019-06-04 v2 计算机视觉与模式识别 机器学习 音频与语音处理 图像与视频处理

摘要

声音画像旨在从语音中推断各种人类参数,例如性别、年龄等。在本文中,我们解决声音画像子任务提出的挑战——从某人的声音重建其人脸。该任务旨在回答以下问题:给定一段由未见过的人员所说的音频片段,我们能否描绘出一张在身份方面与说话者具有尽可能多共同元素或关联的面部图像?为解决此问题,我们提出了一个基于生成对抗网络(GANs)的简单而有效的计算框架。该网络通过在训练集上将生成人脸的身份与说话者身份进行匹配,来学习从声音生成人脸。我们通过利用一项紧密相关的任务——跨模态匹配,来评估网络的性能。结果表明,我们的模型能够生成与说话者若干生物特征相匹配的人脸,并且匹配准确率远优于随机猜测。

关键词

引用

@article{arxiv.1905.10604,
  title  = {Reconstructing faces from voices},
  author = {Yandong Wen and Rita Singh and Bhiksha Raj},
  journal= {arXiv preprint arXiv:1905.10604},
  year   = {2019}
}