中文

基于领域多样化与泛化的跨语料口语语言识别

音频与语音处理 2023-03-02 v1 计算与语言 机器学习 声音

摘要

本工作针对低资源口语语言识别(LID)的跨语料泛化问题。我们在印度 LID 背景下进行了实验,发现由于依赖于语料的非语言偏差,跨语料泛化性能极差。本工作的贡献有两点。首先,我们提出领域多样化,利用不同的音频数据增强方法对有限的训练数据进行多样化。随后我们提出最大多样性感知级联增强的概念,并优化增强折叠因子以实现训练数据的有效多样化。其次,我们将增强方法视为伪领域,引入领域泛化的思想。为此,我们研究了领域不变与领域感知两类方法。我们的 LID 系统基于最先进的强调通道注意力、传播与聚合的时延神经网络(ECAPA-TDNN)架构。我们使用三个广泛使用的印度 LID 语料进行了大量实验。此外,我们在野外收集的 VoxLingua107 语料的印度子集上对所提方法进行了最终的盲评估。实验表明,所提领域多样化比常用的简单增强方法更有前景。研究还揭示,领域泛化是比领域多样化更有效的解决方案。我们还注意到,领域感知学习在同语料 LID 中表现更好,而领域不变学习更适用于跨语料泛化。与基础 ECAPA-TDNN 相比,其提出的领域不变扩展将跨语料 EER 提升了至多 5.23%。相比之下,所提领域感知扩展在同语料测试场景中也改善了性能。

关键词

引用

@article{arxiv.2302.05110,
  title  = {Cross-Corpora Spoken Language Identification with Domain Diversification and Generalization},
  author = {Spandan Dey and Md Sahidullah and Goutam Saha},
  journal= {arXiv preprint arXiv:2302.05110},
  year   = {2023}
}

备注

Accepted for publication in Elsevier Computer Speech & Language