中文

现代与历史文本中的字符熵:未解读手稿的比较度量

计算与语言 2021-05-20 v2

摘要

本文概述了用于伏尼契手稿多语言比较和分析的三个语料库的创建:按 Currier 语言、抄写员手迹和转写系统划分的伏尼契文本语料库、从 Wikipedia 编译的 294 个语言样本语料库,以及包含八种语言的十八份转写历史文本语料库。这些语料库将供耶鲁大学伏尼契工作组在后续工作中使用。我们通过对伏尼契文的条件字符熵分析,展示了这些语料库在研究伏尼契文字和语言特性方面的效用。我们讨论了字符熵与语言、文字大小与类型、字形组合性、抄写约定与缩写、位置字符变体以及二元词频之间的相互作用。该分析刻画了文字组合性、字符大小和可预测性之间的相互作用。我们表明,对字形组合的大量操作不足以使条件熵水平与自然语言对齐。伏尼契文字异常高的可预测性不能归因于特定的文字或转写系统、底层语言或替换密码。伏尼契文与语料库中的所有比较文本都不同,因为字符在词内的位置受到高度约束,这可能表明底层语言中音位区分的丧失。

关键词

引用

@article{arxiv.2010.14697,
  title  = {Character Entropy in Modern and Historical Texts: Comparison Metrics for an Undeciphered Manuscript},
  author = {Luke Lindemann and Claire Bowern},
  journal= {arXiv preprint arXiv:2010.14697},
  year   = {2021}
}

备注

Updated following updates to corpus files (see paper for details)