重新审视词长的最优性
计算与语言
2023-12-08 v1
摘要
Zipf(1935)假设词形经过优化以最小化话语的交际代价。在代价由话语长度给定的假设下,他通过证明词长与其频率呈负相关来支持这一主张。然而,交际代价可以通过不同方式操作化。Piantadosi 等人(2011)声称代价应通过话语信息率与信道容量之间的距离来衡量,我们在此将其称为信道容量假说(CCH)。遵循这一逻辑,他们随后提出词长应与其惊异率(上下文中的负对数概率)的期望值成正比。在本研究中,我们表明 Piantadosi 等人的推导并未最小化 CCH 的代价,而是最小化了一个下界,我们称之为 CCH-lower。我们提出了一种新的推导,建议了一种改进的最小化 CCH 代价的方法。在此方法下,我们发现一种语言的词长应与惊异率的期望加上其方差均值比成正比。在实验中,我们比较了这三种交际代价函数:Zipf 的代价函数、CCH-lower 和 CCH。在 13 种语言和多种实验设置中,我们发现频率比其他两种假说能更好地预测词长。事实上,当使用更好的语言模型来估计惊异率的期望,或期望加上方差均值比时,会导致更差的词长预测。我们将这些结果视为 Zipf 长期假说成立的证据。
引用
@article{arxiv.2312.03897,
title = {Revisiting the Optimality of Word Lengths},
author = {Tiago Pimentel and Clara Meister and Ethan Gotlieb Wilcox and Kyle Mahowald and Ryan Cotterell},
journal= {arXiv preprint arXiv:2312.03897},
year = {2023}
}
备注
Published at EMNLP 2023