中文

FAMA:首个面向英语和意大利语的大规模开放科学语音基础模型

计算与语言 2025-06-03 v2 人工智能 声音

摘要

Whisper 和 SeamlessM4T 等语音基础模型 (SFMs) 的发展显著推进了语音处理领域。然而,它们的封闭性质——训练数据和代码不可获取——给可复现性和公平评估带来了重大挑战。尽管其他领域通过在开源 (OS) 代码和数据上训练完全透明的模型,在迈向开放科学方面取得了实质性进展,但语音领域的类似努力仍然有限。为了填补这一空白,我们介绍了 FAMA,这是首个面向英语和意大利语的开放科学 SFMs 家族,在超过 15 万小时的 OS 语音数据上训练而成。此外,我们提出了一个新数据集,包含两种语言共计 1.6 万小时的清洗和伪标注语音。结果表明,与现有的 SFMs 相比,FAMA 实现了具有竞争力的性能,且速度最高快 8 倍。所有工件(包括代码、数据集和模型)均在 OS 兼容许可下发布,以促进语音技术研究中的开放性。

关键词

引用

@article{arxiv.2505.22759,
  title  = {FAMA: The First Large-Scale Open-Science Speech Foundation Model for English and Italian},
  author = {Sara Papi and Marco Gaido and Luisa Bentivogli and Alessio Brutti and Mauro Cettolo and Roberto Gretter and Marco Matassoni and Mohamed Nabih and Matteo Negri},
  journal= {arXiv preprint arXiv:2505.22759},
  year   = {2025}
}