中文

音系后验的结构化稀疏性在语言解析中的应用

计算与语言 2016-09-16 v3

摘要

语音信号传达不同时间尺度的信息,从与音系和语音信息相关的短时间尺度或段级,到与音节和韵律信息相关的长时间尺度或超段级。语言学和神经认知研究认识到段级上的音系类别是语音时间组织中所使用的基本且不变的表征。在语音处理背景下,深度神经网络(DNN)是一种从短语音段推断个体音系类别概率的有效计算方法。所有音系类别概率的向量被称为音系后验(phonological posterior)。包含短语音段的类别极少,因此音系后验是一个稀疏向量。尽管音系后验是在段级估计的,我们主张它们传达了超段信息。具体地,我们证明音系后验可指示音节与韵律事件。基于来自发音音系学(Articulatory Phonology)姿态模型的汇聚语言学证据以及言语感知的神经基础,我们假设音系后验在多个时间尺度上传达语言类别的属性,并且该信息嵌入其活跃系数的支撑(索引)中。为验证此假设,我们获得段级音系后验的二值表示,称为一阶稀疏结构;高阶结构通过一阶二值向量的拼接获得。随后证实,被称为语言解析(linguistic parsing)的超段语言事件分类问题,可以通过使用一阶或高阶结构的简单二值模式匹配以高精度实现。

关键词

引用

@article{arxiv.1601.05647,
  title  = {On Structured Sparsity of Phonological Posteriors for Linguistic Parsing},
  author = {Milos Cernak and Afsaneh Asaei and Hervé Bourlard},
  journal= {arXiv preprint arXiv:1601.05647},
  year   = {2016}
}