中文

上下文树选择与从书面文本中提取语言节奏

机器学习 2012-03-20 v4 应用统计

摘要

本文的出发点是这样一个问题:“如何从书面文本中提取节奏的指纹?”我们以巴西葡萄牙语和欧洲葡萄牙语为例来解决这个问题。现代葡萄牙语的这两种方言共享相同的词汇,它们产生的大多数句子在表面上完全相同。然而,基于语言学上的推测,它们被认为实现了不同的节奏。我们表明,这个语言学问题可以表述为变长马尔可夫链类中的模型选择问题。为了实施这种方法,我们比较了欧洲葡萄牙语和巴西葡萄牙语的文本。这些文本事先根据句子的一些基本节奏特征进行编码,这些特征可以自动提取。从语言学的角度来看,这是一种全新的方法。我们的统计贡献是引入了最小最大化准则,这是一种无需常数的模型选择程序。作为副产品,这为在使用BIC选择变长马尔可夫链时最优选择惩罚常数的问题提供了解决方案。除了证明当样本量发散时最小最大化准则的一致性外,我们还进行了一项模拟研究,将我们的方法与标准BIC选择以及Peres-Shields阶数估计进行了比较。应用于我们为案例研究构建的语言样本时,最小最大化准则为葡萄牙语的两种方言分配了不同的上下文树模型。所选模型的特征与语言学文献中当前讨论的推测相符。

关键词

引用

@article{arxiv.0902.3619,
  title  = {Context tree selection and linguistic rhythm retrieval from written texts},
  author = {Antonio Galves and Charlotte Galves and Jesús E. García and Nancy L. Garcia and Florencia Leonardi},
  journal= {arXiv preprint arXiv:0902.3619},
  year   = {2012}
}

备注

Published in at http://dx.doi.org/10.1214/11-AOAS511 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)