中文

通过编码细化和语言感知解码适配 Whisper 处理代码切换

计算与语言 2025-01-07 v3 声音 音频与语音处理

摘要

代码切换(Code-Switching, CS)自动语音识别(ASR)面临由于accent、听觉相似性以及无缝语言切换导致的语言混淆挑战。对预训练多语言模型进行适应在CS-ASR中显示出有前景的性能。在本文中,我们从编码器和解码器两个方面适配 Whisper,这是一个大规模多语言预训练语音识别模型。首先,我们提出了编码器细化器以增强编码器对句子内切换的能力。其次,我们提出使用两套语言感知适配器,配合不同的语言提示嵌入,以实现每个解码器层的语言特定解码信息。然后,添加了一个融合模块用于融合语言感知解码。实验结果使用 SEAME 数据集显示,与基线模型相比,所提出的方法在 dev_man 和 dev_sge 测试集上分别实现了4.1%和7.2%的相对 MER 降低,超越了最先进的方法。通过实验,我们发现所提出的方法在 CS 语音中的非本国语言上性能显著提升,表明我们的方法能够更好地区分两种语言。

关键词

引用

@article{arxiv.2412.16507,
  title  = {Adapting Whisper for Code-Switching through Encoding Refining and Language-Aware Decoding},
  author = {Jiahui Zhao and Hao Shi and Chenrui Cui and Tianrui Wang and Hexin Liu and Zhaoheng Ni and Lingxuan Ye and Longbiao Wang},
  journal= {arXiv preprint arXiv:2412.16507},
  year   = {2025}
}