中文

细粒度且可解释的神经语音编辑

音频与语音处理 2024-07-09 v1 声音

摘要

对语音属性(例如韵律(即音高、响度和音素时长)、发音、说话人身份和共振峰)进行细粒度编辑,对于微调和修复人类及AI生成的语音录音中的缺陷非常有用,可用于创建播客、电影对话和视频游戏对话。现有的语音合成系统使用将两个或多个这些属性纠缠在一起的表示,这阻碍了它们在细粒度、解耦编辑中的应用。在本文中,我们展示了第一个解耦且可解释的语音表示,其在主观和客观的声码重建精度上与梅尔频谱图相当。我们的可解释表示,结合我们提出的数据增强方法,使得训练现有的神经声码器能够对音高、时长、音量、音量的音色相关性、发音、说话人身份和频谱平衡进行快速、准确且高质量的编辑。

关键词

引用

@article{arxiv.2407.05471,
  title  = {Fine-Grained and Interpretable Neural Speech Editing},
  author = {Max Morrison and Cameron Churchwell and Nathan Pruyne and Bryan Pardo},
  journal= {arXiv preprint arXiv:2407.05471},
  year   = {2024}
}

备注

Interspeech 2024