面向无障碍功能的紧凑型神经网络语音合成
声音
2025-01-30 v1 机器学习
音频与语音处理
摘要
当代面向无障碍应用的文本语音合成解决方案通常可分为两类:(i) 基于设备的统计参数语音合成(SPSS)或单元选择(USEL),以及 (ii) 基于云端的神经网络语音合成。SPSS 和 USEL 在延迟和磁盘占用方面表现良好,但以然然和音频质量为代价。基于云端的神经网络语音合成系统在音频质量和自然度方面显著优于前者,但在延迟和响应性方面有回退,使其在实际应用中不够实用。更近期地,神经语音模型被移植到便携式设备上运行。尽管如此,延迟仍高于 SPSS 和 USEL,磁盘占用也限制了多个语音模型同时预装的可能性。本文描述了一个在延迟可达 15 毫秒且磁盘占用较小的高质量紧凑型神经语音合成系统。该方案可在低功耗设备上运行。
引用
@article{arxiv.2501.17332,
title = {Compact Neural TTS Voices for Accessibility},
author = {Kunal Jain and Eoin Murphy and Deepanshu Gupta and Jonathan Dyke and Saumya Shah and Vasilieios Tsiaras and Petko Petkov and Alistair Conkie},
journal= {arXiv preprint arXiv:2501.17332},
year = {2025}
}
备注
Accepted at ICASSP 2025