自然语言词汇增长的随机模型
物理与社会
2013-05-16 v3 计算与语言
数据分析、统计与概率
摘要
我们提出了一个关于给定数据库中不同单词数量的随机模型,该模型 Incorporates 了对数据库规模和历史变化的依赖性。我们模型的主要特征是存在两类不同的单词:(i) 有限数量的核心词,它们具有较高的频率,且不影响新词被使用的概率;(ii) 剩余 virtually infinite 数量的非核心词,它们具有较低的频率,且一旦被使用会降低未来新词被使用的概率。我们的模型依赖于对过去几个世纪出版的书籍的 google-ngram 数据库的仔细分析,其主要后果是将 Zipf 定律和 Heaps 定律推广到两个标度机制。我们证实,这些推广在通用描述模型中提供了对数据的最佳简单描述,并且两个自由参数仅取决于语言而不取决于数据库。从我们模型的角度来看,历史时间尺度上的主要变化是包含在有限核心词列表中的特定单词的组成,我们观察到对于英语而言,这种组成随时间呈指数衰减,速率约为每年 30 个单词。
引用
@article{arxiv.1212.1362,
title = {Stochastic model for the vocabulary growth in natural languages},
author = {Martin Gerlach and Eduardo G. Altmann},
journal= {arXiv preprint arXiv:1212.1362},
year = {2013}
}
备注
corrected typos and errors in reference list; 10 pages text, 15 pages supplemental material; to appear in Physical Review X