对巴黎法语语音识别进行大型预训练多语言模型基准测试
音频与语音处理
2025-09-01 v1
摘要
我们评估了大型预训练多语言语音识别模型在加拿大魁北克地区法语方言中的性能,包括速度、词错率和语义准确性。为此,我们基于魁北克委员会数据集构建了一个基准和评估管道,该数据集包含近期在魁北克公开听证会期间录制的随意对话。我们观察到的模型在 FLEURS 或 CommonVoice 等著名基准测试上的表现,不能很好地预测我们在 CommissionsQC 上看到的表现。我们的结果对于关注在真实条件下或地区语言变体方面构建语音应用的实践者具有重要意义。
引用
@article{arxiv.2508.21193,
title = {Benchmarking Large Pretrained Multilingual Models on Qu\'ebec French Speech Recognition},
author = {Coralie Serrand and Gilles Boulianne and Amira Morsli},
journal= {arXiv preprint arXiv:2508.21193},
year = {2025}
}
备注
11 pages, 3 figures