中文

视听说话人转换:联合且同时变换面部表情与声学特征

音频与语音处理 2018-12-04 v2 计算与语言 机器学习 声音 机器学习

摘要

本文提出一种视听说话人转换方法,用于同时将源说话人的面部表情与声音转换为目标说话人的相应特征。联合变换面部与声学特征,可使转换后的声音与面部表情高度相关,并令生成的目标说话人外观与自然听感俱佳。该方法使用三个神经网络:一个融合并转换面部与声学特征的转换网络;一个由转换后的面部与声学特征共同生成波形的波形生成网络;以及一个同样基于两种转换特征输出 RGB 面部图像的图像重建网络。使用情感视听数据库的实验结果表明,与分别转换声学与面部特征的方法相比,所提方法的自然度显著更高。

关键词

引用

@article{arxiv.1810.12730,
  title  = {Audiovisual speaker conversion: jointly and simultaneously transforming facial expression and acoustic characteristics},
  author = {Fuming Fang and Xin Wang and Junichi Yamagishi and Isao Echizen},
  journal= {arXiv preprint arXiv:1810.12730},
  year   = {2018}
}

备注

Submitted to ICASSP 2019