具有声音克隆的非自回归实时口音转换模型
声音
2024-05-24 v1 人工智能
音频与语音处理
摘要
目前,外语口音转换(FAC)模型的开发利用了深度神经网络架构,以及用于语音识别和语音生成的神经网络集成。这些模型的使用受到架构特征的限制,不允许灵活地改变生成语音的音色,并且需要积累上下文,导致生成延迟增加,使得这些系统不适用于实时多用户通信场景。我们开发了一种用于实时口音转换和声音克隆的非自回归模型。该模型基于输入的 L2 口音语音,以最小的延迟生成听起来像母语的 L1 语音。该模型由相互连接的模块组成,用于提取口音、性别和说话人嵌入,转换语音,生成频谱图,并将生成的频谱图解码为音频信号。该模型能够实时保存、克隆和改变说话人声音的音色、性别和口音。客观评估结果表明,该模型提高了语音质量,从而提升了现有 ASR 系统的识别性能。主观测试结果表明,所提出的口音和性别编码器提高了生成质量。所开发的模型展示了高质量、低延迟的口音转换、声音克隆和语音增强能力,使其适用于实时多用户通信场景。
引用
@article{arxiv.2405.13162,
title = {Non-autoregressive real-time Accent Conversion model with voice cloning},
author = {Vladimir Nechaev and Sergey Kosyakov},
journal= {arXiv preprint arXiv:2405.13162},
year = {2024}
}
备注
8 pages, 6 figures, 3 tables