中文

语言识别中的相关性与序列建模探索

音频与语音处理 2020-04-06 v1 计算与语言 机器学习 声音 机器学习

摘要

自动语言识别(LID)任务涉及同一语系的多方言,在噪声存在下是一个具有挑战性的问题。在这些场景中,语言/方言的身份可能仅可靠地存在于语音信号时间序列的部分片段中。传统的LID方法(以及说话人识别)通过提取录音的长时统计摘要,假设特征帧独立,忽略了序列信息。本文提出了一种利用短序列信息的神经网络框架用于语言识别。特别地,提出了一种新模型用于在语言识别中引入相关性,其中语音数据的部分根据其与语言识别任务的相关性被赋予更高权重。这种相关性加权是通过带有注意力建模的双向长短期记忆(BLSTM)网络实现的。我们探索了两种方法:第一种方法使用片段级i-vector/x-vector表示,在神经模型中聚合;第二种方法直接在端到端神经模型中对声学特征进行建模。实验使用NIST LRE 2017挑战中的语言识别任务,包括干净、噪声和多说话人语音数据,以及RATS语言识别语料库。在噪声LRE任务和RATS数据集上的实验表明,所提方法相比传统的基于i-vector/x-vector的语言识别方法以及其他先前包含序列信息的模型,取得了显著改进。

关键词

引用

@article{arxiv.2004.01221,
  title  = {Towards Relevance and Sequence Modeling in Language Recognition},
  author = {Bharat Padi and Anand Mohan and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2004.01221},
  year   = {2020}
}

备注

https://github.com/iiscleap/lre-relevance-weighting Accepted to IEEE Transactions on Audio, Speech and Language Processing