中文

阿拉伯语广播语音方言识别的多视图降维

计算与语言 2016-09-20 v1

摘要

在这项工作中,我们提出了一种用于口语方言识别任务的语音话语向量空间模型(VSM)。通常,DID系统使用从语音话语中提取的两组特征构建:声学和音素特征。声学和音素特征被用于形成语音话语的向量表示,试图编码有关所说方言的信息。由此形成的音位和声学VSM用于DID任务。本文旨在构建一个单一的VSM,从音位和声学VSM中编码有关口语方言的信息。给定数据的两个视图,我们利用一种著名的多视图降维技术,称为典型相关分析(CCA),为每个语音话语形成单一向量表示,该表示编码来自音素和声学表示的方言特定判别信息。我们将此方法称为特征空间组合方法,并表明我们基于CCA的特征向量表示在阿拉伯语DID任务上比单独使用的音素和声学特征表示表现更好。我们还提出特征空间组合方法作为基于模型的组合方法的可行替代方案,后者使用两个VSM(音位和声学)构建两个DID系统,最终预测分数是两个系统输出分数的组合。

关键词

引用

@article{arxiv.1609.05650,
  title  = {Multi-view Dimensionality Reduction for Dialect Identification of Arabic Broadcast Speech},
  author = {Sameer Khurana and Ahmed Ali and Steve Renals},
  journal= {arXiv preprint arXiv:1609.05650},
  year   = {2016}
}