基于奇异值分解特征嵌入的印度地区语言识别与分割
音频与语音处理
2020-05-19 v1 声音
摘要
语言识别(LID)是在给定语音片段中识别一种语言。语言分割与语言识别同等重要,它能在多语言语音片段中定位语言边界。本文针对印度地区语言语境下的语言识别进行了两种方案的实验,因为该方向已有研究甚少。两种方案均使用了基于奇异值的特征嵌入。在第一种方案中,对 n-gram 语句矩阵应用奇异值分解(SVD);在第二种方案中,对差分超向量矩阵空间应用 SVD。我们观察到,在两种方案中,55–65% 的奇异值能量足以捕获语言语境。在基于 n-gram 的特征表示中,我们发现不同的跳字(skipgram)模型捕获不同的语言语境。我们观察到,对于短测试时长,基于超向量的特征表示更优;但对于较长时长的测试信号,基于 n-gram 的特征表现更好。我们还将工作拓展至语言分割的探索,发现对于四语言组、十语言训练模型的分割任务,方案 1 表现良好;但在相同的四语言训练模型下,方案 2 优于方案 1。
引用
@article{arxiv.2005.08229,
title = {Identification/Segmentation of Indian Regional Languages with Singular Value Decomposition based Feature Embedding},
author = {Anirban Bhowmick and Astik Biswas},
journal= {arXiv preprint arXiv:2005.08229},
year = {2020}
}