中文

基于多任务预训练与迁移学习的简洁高效语码转换语言识别

计算与语言 2023-06-01 v1 音频与语音处理

摘要

语码转换,亦称语码混合,是一种语言学现象:在多语者的随意语境中,其于同一话语里混杂来自不同语言的词汇。因其自发特性,语码转换极度低资源,这使其成为语言与语音处理任务中的难题。在此类情形下,若欲最大化利用既有单语工具服务于其他任务,语码转换语言识别(CSLID)便成为一项困难却必要的任务。本工作中,我们提出两种新方法以提升在英语-普通话儿童导向语音数据集上的语言识别准确率。我们的方法包括一个堆叠的残差 CNN+GRU 模型,以及一种以自动语音识别(ASR)作为 CSLID 辅助任务的多任务预训练方法。鉴于语码转换的低资源特性,我们还利用两语言单语语料库精心构造银数据并以上采样作为数据增强。我们聚焦于英语-普通话语码转换数据,但所提方法适用于任意语言对。我们的最佳模型在真实英语-普通话语码转换儿童导向语音语料上取得 0.781 的均衡准确率,较先前基线提升 55.3%。

关键词

引用

@article{arxiv.2305.19759,
  title  = {Simple yet Effective Code-Switching Language Identification with Multitask Pre-Training and Transfer Learning},
  author = {Shuyue Stella Li and Cihan Xiao and Tianjian Li and Bismarck Odoom},
  journal= {arXiv preprint arXiv:2305.19759},
  year   = {2023}
}

备注

8 pages, 3 figures, 7 tables