中文

RobustL2S:利用自监督表征的说话人特定唇语转语音合成

声音 2023-07-06 v1 机器学习 音频与语音处理

摘要

在说话人相关的唇语转语音(Lip-to-Speech)合成方面已取得显著进展,其旨在从说话人脸部的静音视频生成语音。当前最先进的方法主要采用非自回归序列到序列架构,直接从唇部表征预测梅尔频谱图或音频波形。我们假设,由于语音内容与环境信息及说话人特征相互纠缠,直接的梅尔预测损害了训练与模型效率。为此,我们提出 RobustL2S,一种模块化的唇语转语音合成框架。首先,一个非自回归序列到序列模型将自监督视觉特征映射为解纠缠的语音内容表征。随后,声码器将语音特征转换为原始波形。大量评估证实了我们的设置的有效性,在无约束的 Lip2Wav 数据集以及受约束的 GRID 和 TCD-TIMIT 数据集上取得了最先进的性能。RobustL2S 的语音样本可在 https://neha-sherin.github.io/RobustL2S/ 获取。

关键词

引用

@article{arxiv.2307.01233,
  title  = {RobustL2S: Speaker-Specific Lip-to-Speech Synthesis exploiting Self-Supervised Representations},
  author = {Neha Sahipjohn and Neil Shah and Vishal Tambrahalli and Vineet Gandhi},
  journal= {arXiv preprint arXiv:2307.01233},
  year   = {2023}
}