中文

具有声音克隆的非自回归实时口音转换模型

声音 2024-05-24 v1 人工智能 音频与语音处理

摘要

目前,外语口音转换(FAC)模型的开发利用了深度神经网络架构,以及用于语音识别和语音生成的神经网络集成。这些模型的使用受到架构特征的限制,不允许灵活地改变生成语音的音色,并且需要积累上下文,导致生成延迟增加,使得这些系统不适用于实时多用户通信场景。我们开发了一种用于实时口音转换和声音克隆的非自回归模型。该模型基于输入的 L2 口音语音,以最小的延迟生成听起来像母语的 L1 语音。该模型由相互连接的模块组成,用于提取口音、性别和说话人嵌入,转换语音,生成频谱图,并将生成的频谱图解码为音频信号。该模型能够实时保存、克隆和改变说话人声音的音色、性别和口音。客观评估结果表明,该模型提高了语音质量,从而提升了现有 ASR 系统的识别性能。主观测试结果表明,所提出的口音和性别编码器提高了生成质量。所开发的模型展示了高质量、低延迟的口音转换、声音克隆和语音增强能力,使其适用于实时多用户通信场景。

关键词

引用

@article{arxiv.2405.13162,
  title  = {Non-autoregressive real-time Accent Conversion model with voice cloning},
  author = {Vladimir Nechaev and Sergey Kosyakov},
  journal= {arXiv preprint arXiv:2405.13162},
  year   = {2024}
}

备注

8 pages, 6 figures, 3 tables