中文

探测未知文本的统计特性:应用于伏尼契手稿

物理与社会 2013-07-04 v1 计算与语言 数据分析、统计与概率

摘要

尽管使用统计物理方法分析大型语料库有助于揭示文本中的许多模式,但尚未有全面的研究调查不同语言和文本中统计测量的特性。在本研究中,我们提出了一个框架,旨在确定文本是否与自然语言兼容,以及哪些语言与之最接近,而无需了解单词的含义。该方法基于三种类型的统计测量,即从文本中单词属性的一阶统计量、表示文本的复杂网络的拓扑结构以及将文本视为时间序列的间歇性概念中获得的测量。我们使用15种不同语言的《新约》以及英语和葡萄牙语的不同书籍进行了比较实验,以量化不同测量对语言和书籍所讲述故事的依赖性。在区分真实文本与其打乱版本方面具有信息量的度量包括同配性、度和单词选择性。作为示例,我们分析了一份未破译的中世纪手稿——伏尼契手稿。我们表明,它主要与自然语言兼容,而与随机文本不兼容。我们还获得了伏尼契手稿的关键词候选,这可能有助于破译工作。由于我们能够识别出更依赖于句法而非语义的统计测量,该框架也可用于依赖语言的应用中的文本分析。

关键词

引用

@article{arxiv.1303.0347,
  title  = {Probing the statistical properties of unknown texts: application to the Voynich Manuscript},
  author = {Diego R. Amancio and Eduardo G. Altmann and Diego Rybski and Osvaldo N. Oliveira and Luciano da F. Costa},
  journal= {arXiv preprint arXiv:1303.0347},
  year   = {2013}
}