Miipher-2:用于百万小时级数据修复的通用语音修复模型
声音
2025-07-24 v4 计算与语言
音频与语音处理
摘要
训练数据清洗是基于生成模型的语音修复(SR)的一项新应用。本文介绍了 Miipher-2,一种为百万小时级数据设计的 SR 模型,用于大型生成模型(如大型语言模型)的训练数据清洗。解决的关键挑战包括对未见语言的泛化、无显式条件(如文本、说话人 ID)下的运行以及计算效率。Miipher-2 利用支持 300 多种语言的冻结预训练通用语音模型(USM)作为稳健的无条件特征提取器。为了优化效率并最小化内存,Miipher-2 引入了并行适配器以从含噪输入预测干净的 USM 特征,并采用 WaveFit 神经声码器进行波形合成。这些组件在 3000 小时的多语言录音室质量录音及增强退化数据上进行训练,而 USM 参数保持固定。实验结果表明,在所有测试语言中,Miipher-2 在词错误率、说话人相似度以及客观和主观音质得分方面,均优于或可比于传统 SR 模型。Miipher-2 在消费级加速器上高效运行,实现了 0.0078 的实时因子,仅需 100 个此类加速器即可在大约三天内处理百万小时语音数据集。
引用
@article{arxiv.2505.04457,
title = {Miipher-2: A Universal Speech Restoration Model for Million-Hour Scale Data Restoration},
author = {Shigeki Karita and Yuma Koizumi and Heiga Zen and Haruko Ishikawa and Robin Scheibler and Michiel Bacchiani},
journal= {arXiv preprint arXiv:2505.04457},
year = {2025}
}
备注
Accepted to IEEE WASPAA2025