PHO-LID:融合声学音位与音位结构信息的统一语言识别模型
音频与语音处理
2022-04-01 v2
摘要
我们提出了一种新颖的模型,可在无需音素标注进行训练的情况下,分层融合音素与音位结构信息用于语言识别(LID)。该模型名为PHO-LID,其中自监督音素分割任务与LID任务共享一个卷积神经网络(CNN)模块,该模块对输入语音中的语言身份与序列音素信息进行编码,生成音位结构嵌入的中间序列。这些嵌入随后被送入transformer编码器层以进行话语级LID。我们将此架构称为CNN-Trans。我们在AP17-OLR数据与NIST LRE 2017的MLS14集上对其进行评估,结果表明采用多任务优化的PHO-LID模型在所有模型中LID性能最高,相较于仅针对LID优化的CNN-Trans模型,在AP17-OLR数据上平均代价相对提升超过40%。可视化的混淆矩阵表明,相较于CNN-Trans模型,我们所提方法在NIST LRE 2017数据中同簇语言上取得了更高性能。预测音素边界与相应音频谱图之间的对比说明了利用音素信息进行LID的过程。
引用
@article{arxiv.2203.12366,
title = {PHO-LID: A Unified Model Incorporating Acoustic-Phonetic and Phonotactic Information for Language Identification},
author = {Hexin Liu and Leibny Paola Garcia Perera and Andy W. H. Khong and Suzy J. Styles and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2203.12366},
year = {2022}
}
备注
Submitted to Interspeech 2022, updated to the submitted version