中文

句法依存距离的分布

计算与语言 2025-08-12 v3

摘要

句子的句法结构可表示为图,其中顶点为词,边表示它们之间的句法依存关系。在此设定下,两个相连词之间的距离定义为其位置之差。此处我们希望有助于刻画句法依存距离的实际分布,此前被认为服从幂律分布。本文提出一个具有两个指数区间的新模型,其中概率衰减允许在断点后发生改变。这一转变可能反映了从词块处理到更高层结构的过渡。我们发现,一个双区间模型——其中第一区间服从指数或幂律衰减——在我们考察的所有20种语言中最有可能成立,且与句子长度和标注风格无关。此外,断点跨语言变化很小,平均值为4-5个词,表明可同时处理的词数量在很大程度上抽象于具体语言。概率衰减在断点后放缓,与一种通用的分块传递机制一致。最后,我们根据最近引入的最优性分数,给出了最佳估计模型与句法依存紧密性随句子长度变化之间关系的说明。

关键词

引用

@article{arxiv.2211.14620,
  title  = {The distribution of syntactic dependency distances},
  author = {Sonia Petrini and Ramon Ferrer-i-Cancho},
  journal= {arXiv preprint arXiv:2211.14620},
  year   = {2025}
}

备注

minor corrections; in press in Glottometrics