XCB:用于语音识别中偏置跨语言短语的有效上下文方法
计算与语言
2024-08-21 v1 人工智能
声音
音频与语音处理
摘要
上下文化 ASR 模型已被证明在可用预定义短语列表时能有效提高不常见短语的识别准确率。然而,这些模型在双语环境中常常难以处理,这在代码切换语音识别中十分常见。本研究通过引入跨语言上下文偏置 (XCB) 模块来初步解决这一挑战。具体而言,我们通过集成一个辅助语言偏置模块和一个补充语言特定损失,来增强主导语言的预训练 ASR 模型,以提高二次语言短语的识别效果。我们在自己的内部代码切换数据集上进行的实验结果表明,我们的方法有效,显著提高了二次语言中偏置短语的识别准确率,且无需额外的推理开销。此外,我们提出的系统在应用于未见的 ASRU-2019 测试集时也表现出良好的效率和泛化能力。
引用
@article{arxiv.2408.10524,
title = {XCB: an effective contextual biasing approach to bias cross-lingual phrases in speech recognition},
author = {Xucheng Wan and Naijun Zheng and Kai Liu and Huan Zhou},
journal= {arXiv preprint arXiv:2408.10524},
year = {2024}
}
备注
accepted to NCMMSC 2024