中文

赋能沟通:通过 AI 驱动的语音合成服务印度和西方口音的语音技术

音频与语音处理 2024-02-19 v2 声音

摘要

神经文本转语音 (TTS) 合成是一项强大的技术,可利用神经网络生成语音。TTS 合成最显著的特征之一是其能够以不同说话人的声音生成语音。本文介绍了语音克隆和语音合成 https://pypi.org/project/voice-cloning/,这是一个开源 Python 包,旨在帮助言语障碍者更有效地沟通,同时也服务于寻求将语音克隆或语音合成功能集成到其项目中的专业人士。该包旨在生成听起来像个人自然声音的合成语音,但并不替代自然的人声。系统架构包括说话人验证系统、合成器、声码器和降噪模块。说话人验证系统在多样化的说话人集合上进行训练,以在不依赖转录的情况下实现最佳的泛化性能。合成器利用音频和转录进行训练,从文本生成梅尔频谱图,而声码器则将生成的梅尔频谱图转换为相应的音频信号。随后,音频信号经过降噪算法处理,以消除不必要的噪声并增强语音清晰度。然后使用主观和客观评估(如平均意见得分 (MOS)、基频 Gross 误差 (GPE) 和频谱失真 (SD))对来自可见和不可见说话人的合成语音性能进行评估。该模型可以通过包含随机选择的说话人特征来创建不同声音的语音。

关键词

引用

@article{arxiv.2401.11771,
  title  = {Empowering Communication: Speech Technology for Indian and Western Accents through AI-powered Speech Synthesis},
  author = {Vinotha R and Hepsiba D and L. D. Vijay Anand and Deepak John Reji},
  journal= {arXiv preprint arXiv:2401.11771},
  year   = {2024}
}