基于拼接分词器的码切换语音识别与语言识别统一模型
音频与语音处理
2023-09-19 v3 计算与语言
声音
摘要
码切换(CS)多语言自动语音识别(ASR)模型能够转写对话中包含两种或多种交替语言的语言。本文提出(1)一种从纯单语数据源创建码切换ASR数据集的新方法,以及(2)一种新颖的拼接分词器(Concatenated Tokenizer),它使ASR模型能够为每个输出的文本词元生成语言ID,同时复用现有的单语分词器。这些构建CS ASR模型的方法的有效性在英语-印地语和英语-西班牙语两种语言对上得到验证,我们在Miami Bangor CS评估语料库上取得了新的最先进结果。除具有竞争力的ASR性能外,所提出的拼接分词器模型对口语语言识别也非常有效,在分布外FLEURS数据集上达到了98%以上的准确率。
引用
@article{arxiv.2306.08753,
title = {Unified model for code-switching speech recognition and language identification based on a concatenated tokenizer},
author = {Kunal Dhawan and Dima Rekesh and Boris Ginsburg},
journal= {arXiv preprint arXiv:2306.08753},
year = {2023}
}