从模型与数据视角洞察代码切换语音识别
音频与语音处理
2026-03-18 v2
摘要
代码切换自动语音识别(CS-ASR)由于自然句内切换引入的语言混淆以及模糊化音素边界的方言偏见,面临独特挑战。虽然组成语言各自都可能是高资源语言,但标注的代码切换数据稀缺进一步加剧了这些挑战。本文从模型中心和数据中心两个视角系统性分析CS-ASR。通过比较最先进的算法方法,包括语言特定处理和辅助语言感知多任务学习,我们讨论了这些方法在具有不同语言特征的数据集上的效能差异。在数据方面,我们首先研究TTS作为数据增强方法。通过变化文本特征和说话人方言,我们分析了语言混淆和方言偏见对CS-ASR的影响。为进一步缓解数据稀缺并增强文本多样性,我们提出一种通过简化等价约束理论(SECT)指导大语言模型(LLM)生成语言上有效代码切换文本的提示策略。所提出的SECT在ASR性能和语言质量评估方面优于现有方法,生成的文本更接近真实世界的代码切换文本。当用于通过TTS生成语音-文本对时,SECT在改善CS-ASR性能方面效果显著。我们对模型与数据中心方法的分析表明,有效的CS-ASR需要策略与代码切换数据的特定语言特征精确匹配。
引用
@article{arxiv.2509.24310,
title = {Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives},
author = {Hexin Liu and Haoyang Zhang and Qiquan Zhang and Xiangyu Zhang and Dongyuan Shi and Eng Siong Chng and Haizhou Li},
journal= {arXiv preprint arXiv:2509.24310},
year = {2026}
}
备注
14 pages, 4 figures, 10 tables, accepted to IEEE TASLP. Copyright has been transferred to IEEE