中文

利用频谱增强进行语码转换语音语言识别

计算与语言 2020-10-15 v1 声音 音频与语音处理

摘要

语音语言识别(LID)系统用于识别给定音频样本中所出现的语言,通常可作为自动语音识别(ASR)等许多语音处理相关任务的第一步。自动识别语音信号中的语言不仅具有科学意义,在如印度这样的多语言国家也具有实际重要性。在许多印度城市,人们相互交流时可能混合多达三种语言,包括该邦的官方语言、印地语和英语(有时邻近邦的语言也可能在交流中混合)。这使得印度语境下的语音 LID 任务极具挑战性。尽管已实现若干面向印度语言的 LID 系统,但多数使用机构内部收集的小规模语音数据。本工作中,我们对与英语语码混合的三种印度语言(古吉拉特语、泰卢固语和泰米尔语)进行语音 LID。该任务由微软研究团队作为语音 LID 挑战赛组织。我们修改常规的频谱增强方法,提出区分语言 ID 对的语言掩码,从而得到对噪声鲁棒的语音 LID 系统。所提方法在挑战赛建议的两个共享任务的三组语言对上,相较微软提出的基线系统取得约 3-5% 的 LID 准确率相对提升。

关键词

引用

@article{arxiv.2010.07130,
  title  = {Exploiting Spectral Augmentation for Code-Switched Spoken Language Identification},
  author = {Pradeep Rangan and Sundeep Teki and Hemant Misra},
  journal= {arXiv preprint arXiv:2010.07130},
  year   = {2020}
}

备注

5 pages, 3 figures, Accepted for INTERSPEECH-2020 - "First Workshop on Speech Technologies for Code-switching in Multilingual Communities 2020"