中文

面向加泰罗尼亚语-西班牙语代码转换的 ASR 优化:方法对比分析

计算与语言 2025-07-21 v1 音频与语音处理

摘要

代码转换(CS)指交替使用两种或多种语言,由于训练数据稀缺以及语言之间的相似性,给自动语音识别(ASR)带来了挑战。专用 CS 数据集的缺乏限制了 ASR 性能,因为大多数模型依赖单语种或混合语种语料库,无法反映真实世界中的 CS 模式。在 CS 发生于非正式与正式场合的多语言社会中,这一问题尤为关键。加泰罗尼亚语-西班牙语 CS 即是典型案例,广泛应用于媒体与议会演讲中。在本工作中,我们通过探索三种策略来改进加泰罗尼亚语-西班牙语 CS 的 ASR:(1)生成合成 CS 数据,(2)拼接单语种音频,(3)利用带有语言标记的真实 CS 数据。我们从加泰罗尼亚语语音语料库中提取 CS 数据,并对 OpenAI 的 Whisper 模型进行微调,相关模型已在 Hugging Face 上发布。结果表明,将适量合成 CS 数据与主导语言标记相结合,可获得最佳转写性能。

关键词

引用

@article{arxiv.2507.13875,
  title  = {Optimizing ASR for Catalan-Spanish Code-Switching: A Comparative Analysis of Methodologies},
  author = {Carlos Mena and Pol Serra and Jacobo Romero and Abir Messaoudi and Jose Giraldo and Carme Armentano-Oller and Rodolfo Zevallos and Ivan Meza and Javier Hernando},
  journal= {arXiv preprint arXiv:2507.13875},
  year   = {2025}
}

备注

Accepted at Interspeech 2025