词频分布的实证结构
计算与语言
2020-01-16 v1
摘要
各语言中单个词出现的频率遵循幂律分布,这一发现模式被称为齐夫定律。大量文献争论这是否有助于优化人类交流的效率,然而该主张必然是事后性的,并且有人提出齐夫定律实际上可能描述其他分布的混合。从这一视角看,近期关于汉语圈姓氏(首姓)呈几何分布的研究值得注意,因为这实际上与关于最优编码的信息论预测一致。名字在大多数语言中构成自然的交流分布,并且我表明,当结合使用它们的社群进行分析时,跨多种语言的首名分布既是几何的,而且在历史上极为相似,幂律分布仅在经验分布被聚合时才出现。接着我展示这一发现模式在英语名词和动词的交流分布中可复现。这些结果表明,如果词汇分布支持高效交流,那是因为其功能结构直接满足了信息论所描述的约束,而非因为齐夫定律。理解这些信息结构的功能可能是解释人类非凡交流能力的关键。
引用
@article{arxiv.2001.05292,
title = {The empirical structure of word frequency distributions},
author = {Michael Ramscar},
journal= {arXiv preprint arXiv:2001.05292},
year = {2020}
}