中文

跨语料语言识别:以印度语言为主的初步研究

音频与语音处理 2021-05-13 v2 声音

摘要

本文开展了口语语言识别(LID)问题中跨语料性能评估的极早期研究之一。跨语料评估在 LID 研究中鲜有探索,尤其针对印度语言。我们选取了三个印度口语语料:IIITH-ILSC、LDC South Asian 与 IITKGP-MLILSC。对于每个语料,均基于最先进的时间延迟神经网络(TDNN)架构与 MFCC 特征训练 LID 系统。我们观察到跨语料评估时 LID 性能急剧下降。例如,在 IIITH-ILSC 语料上训练的系统,在同语料与 LDC South Asian 语料上评估的平均等错误率(EER)分别为 11.80% 与 43.34%。我们的初步分析显示这些语料在长期平均谱(LTAS)与信噪比(SNR)失配方面存在显著差异。随后,我们应用不同的特征级补偿方法以降低跨语料声学失配。结果表明这些特征归一化方案有助于在跨语料实验中取得有前景的 LID 性能。

关键词

引用

@article{arxiv.2105.04639,
  title  = {Cross-Corpora Language Recognition: A Preliminary Investigation with Indian Languages},
  author = {Spandan Dey and Goutam Saha and Md Sahidullah},
  journal= {arXiv preprint arXiv:2105.04639},
  year   = {2021}
}

备注

Accepted in EUSIPCO 2021 : European Signal Processing Conference