Sidon:快速且鲁棒的开源多语言语音恢复模型,用于大规模数据集清洗
声音
2026-01-27 v3 音频与语音处理
摘要
大规模文本转语音(TTS)系统受限于干净多语言录音的稀缺。我们提出Sidon,一个快速、开源的语音恢复模型,可将野外噪声语音转换为录音室质量语音,并扩展至数十种语言。Sidon由两个模型组成:基于w2v-BERT 2.0微调的特征预测器,用于从噪声语音中清洗特征;以及训练用于从清洗后的特征合成恢复语音的声码器。Sidon的恢复性能与Miipher相当——Miipher是Google内部用于语音合成数据集清洗的语音恢复模型。Sidon在计算上高效,在单块GPU上运行速度可达实时的500倍。我们进一步证明,使用Sidon清洗后的自动语音识别语料库训练TTS模型,可以在零样本设置下提升合成语音的质量。代码和模型已公开发布,以促进研究社区的可复现数据集清洗。
引用
@article{arxiv.2509.17052,
title = {Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing},
author = {Wataru Nakata and Yuki Saito and Yota Ueda and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2509.17052},
year = {2026}
}
备注
5 pages, 1 figures, Accepted to ICASSP 2026