中文

AsyncSwitch:用于代码切换语音识别的异步文本-语音适应

计算与语言 2025-06-18 v1 声音 音频与语音处理

摘要

开发代码切换语音识别(ASR)系统面临语言模糊性和对多语言、代码切换数据的有限曝光,同时收集此类语音成本高昂。先前工作通过生成合成音频来缓解此问题,但这些方法计算密集且难以扩展。我们引入AsyncSwitch,一种新型的异步适应框架,利用大规模文本丰富的网络数据,在针对语音-文本对数据的微调前,对ASR模型进行预曝光,以适应多样化的代码切换领域。我们的三阶段过程:(1)在代码切换文本上训练解码器自注意力和前馈层;(2)使用有限的语音-文本数据通过交叉注意力对齐解码器和编码器;(3)完全微调整个模型。在Whisper模型上针对马来语-英语代码切换语言实验表明,实现了9.02%的相对词错率(WER)降低,同时改善了单语ASR在新加坡英语(Singlish)、马来语及其他英语变体方面的性能。

关键词

引用

@article{arxiv.2506.14190,
  title  = {AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR},
  author = {Tuan Nguyen and Huy-Dat Tran},
  journal= {arXiv preprint arXiv:2506.14190},
  year   = {2025}
}

备注

This work has been submitted to the IEEE for possible publication. This paper is a preprint version submitted to the 2025 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2025)