中文

面向低资源语言高效无 ASR 关键词检索的特征学习

音频与语音处理 2021-08-16 v1

摘要

我们考虑用于高效关键词检索的特征学习,其可应用于极度资源匮乏的环境。目标是支持联合国在非洲几乎无任何语言资源的地区的人道主义救援项目。为在此类语言中快速开发,我们依赖一个小型、易于编译的孤立关键词集。这些关键词模板通过动态时间规整(DTW)应用于大规模领域内但未转写的语音语料库。所得的 DTW 对齐分数用于训练一个计算效率高几个数量级且适合实时应用的卷积神经网络(CNN)。我们通过在这种近乎零资源的设定中识别鲁棒声学特征来优化该神经网络关键词检索器。首先,我们使用多语言瓶颈特征(BNF)提取器融入来自资源充足但不相关语言的信息。接下来,我们考虑从在领域但未转写数据上训练的自编码器(AE)提取的特征。最后,我们考虑在小型领域内标注数据上微调的对应自编码器(CAE)特征。在南非英语和资源匮乏语言 Luganda 上的实验表明,BNF 和 CAE 特征相较基线 MFCC 取得了 5% 的相对性能提升。然而,将 BNF 作为 CAE 的输入,在 ROC 曲线下面积(AUC)上相较 MFCC 取得了超过 27% 的相对提升,且前 10 检索量超过两倍。我们表明,使用这些特征,CNN-DTW 关键词检索器的表现几乎与 DTW 关键词检索器相当,同时优于仅在关键词模板上训练的基线 CNN。采用 BNF 衍生的 CAE 特征的 CNN-DTW 关键词检索器代表了一种高效且性能具竞争力的方法,适用于极度资源匮乏场景下的快速部署。

关键词

引用

@article{arxiv.2108.06174,
  title  = {Feature learning for efficient ASR-free keyword spotting in low-resource languages},
  author = {Ewald van der Westhuizen and Herman Kamper and Raghav Menon and John Quinn and Thomas Niesler},
  journal= {arXiv preprint arXiv:2108.06174},
  year   = {2021}
}

备注

37 pages, 14 figures, Preprint accepted for publication in Computer Speech and Language