中文

FastLTS:非自回归端到端无约束唇语转语音合成

声音 2022-07-14 v2 计算与语言 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

无约束唇语转语音合成旨在从说话人脸的静音视频中生成对应语音,且对头部姿态或词汇无限制。当前工作主要使用序列到序列模型解决该问题,采用自回归架构或基于流的非自回归架构。然而,这些模型存在若干缺陷:1)它们不直接生成音频,而是使用两阶段流水线,先生成梅尔谱图再由谱图重建音频,导致部署繁琐且因误差传播而语音质量下降;2)这些模型所用的音频重建算法限制了推理速度与音频质量,而神经声码器因输出谱图不够准确而无法使用;3)自回归模型推理延迟高,基于流的模型内存占用大:二者在时间与内存使用上均不够高效。为解决这些问题,我们提出FastLTS,一种非自回归端到端模型,可直接从无约束说话视频以低延迟合成高质量语音音频,且模型规模相对较小。此外,不同于广泛使用的3D-CNN视觉前端进行唇动编码,我们首次提出基于transformer的视觉前端用于此任务。实验表明,在3秒输入序列上,我们的模型相较当前自回归模型在音频波形生成上实现19.76×19.76\times加速,并取得更优音频质量。

关键词

引用

@article{arxiv.2207.03800,
  title  = {FastLTS: Non-Autoregressive End-to-End Unconstrained Lip-to-Speech Synthesis},
  author = {Yongqi Wang and Zhou Zhao},
  journal= {arXiv preprint arXiv:2207.03800},
  year   = {2022}
}

备注

10 pages, 5 figures, accepted by ACMMM 2022