FAMA:首个面向英语和意大利语的大规模开放科学语音基础模型
计算与语言
2025-06-03 v2 人工智能
声音
摘要
Whisper 和 SeamlessM4T 等语音基础模型 (SFMs) 的发展显著推进了语音处理领域。然而,它们的封闭性质——训练数据和代码不可获取——给可复现性和公平评估带来了重大挑战。尽管其他领域通过在开源 (OS) 代码和数据上训练完全透明的模型,在迈向开放科学方面取得了实质性进展,但语音领域的类似努力仍然有限。为了填补这一空白,我们介绍了 FAMA,这是首个面向英语和意大利语的开放科学 SFMs 家族,在超过 15 万小时的 OS 语音数据上训练而成。此外,我们提出了一个新数据集,包含两种语言共计 1.6 万小时的清洗和伪标注语音。结果表明,与现有的 SFMs 相比,FAMA 实现了具有竞争力的性能,且速度最高快 8 倍。所有工件(包括代码、数据集和模型)均在 OS 兼容许可下发布,以促进语音技术研究中的开放性。
引用
@article{arxiv.2505.22759,
title = {FAMA: The First Large-Scale Open-Science Speech Foundation Model for English and Italian},
author = {Sara Papi and Marco Gaido and Luisa Bentivogli and Alessio Brutti and Mauro Cettolo and Roberto Gretter and Marco Matassoni and Mohamed Nabih and Matteo Negri},
journal= {arXiv preprint arXiv:2505.22759},
year = {2025}
}