中文

Miipher-2:用于百万小时级数据修复的通用语音修复模型

声音 2025-07-24 v4 计算与语言 音频与语音处理

摘要

训练数据清洗是基于生成模型的语音修复(SR)的一项新应用。本文介绍了 Miipher-2,一种为百万小时级数据设计的 SR 模型,用于大型生成模型(如大型语言模型)的训练数据清洗。解决的关键挑战包括对未见语言的泛化、无显式条件(如文本、说话人 ID)下的运行以及计算效率。Miipher-2 利用支持 300 多种语言的冻结预训练通用语音模型(USM)作为稳健的无条件特征提取器。为了优化效率并最小化内存,Miipher-2 引入了并行适配器以从含噪输入预测干净的 USM 特征,并采用 WaveFit 神经声码器进行波形合成。这些组件在 3000 小时的多语言录音室质量录音及增强退化数据上进行训练,而 USM 参数保持固定。实验结果表明,在所有测试语言中,Miipher-2 在词错误率、说话人相似度以及客观和主观音质得分方面,均优于或可比于传统 SR 模型。Miipher-2 在消费级加速器上高效运行,实现了 0.0078 的实时因子,仅需 100 个此类加速器即可在大约三天内处理百万小时语音数据集。

关键词

引用

@article{arxiv.2505.04457,
  title  = {Miipher-2: A Universal Speech Restoration Model for Million-Hour Scale Data Restoration},
  author = {Shigeki Karita and Yuma Koizumi and Heiga Zen and Haruko Ishikawa and Robin Scheibler and Michiel Bacchiani},
  journal= {arXiv preprint arXiv:2505.04457},
  year   = {2025}
}

备注

Accepted to IEEE WASPAA2025