中文

基于等价谓词-论元结构句子中频繁词序列的无监督句法分析

计算与语言 2024-08-13 v2

摘要

无监督句法分析聚焦于识别形成语法单元(即构块)的词序列。语言学家通过评估一组等价谓词-论元结构(PAS)的句子,其中我们找到构块在句子集合中出现的频率高于非构块(即构块对应于句子集合中频繁出现的词序列)。然而,此前的方法通过观察PAS结构多样的句子来识别构块,无法获取此类频率信息。在本研究中,我们经验性地表明,构块对应于PAS等价句子集合中频繁出现的词序列。我们提出一种基于频率的解析器span-overlap,该解析器(1)计算span-overlap得分作为该词序列在PAS等价句子集合中的频率,(2)通过寻找具有最大span-overlap得分的构块树来识别构块结构。该解析器在八个语言中实现了达到甚至超越现有无监督解析器的状态水平准确率。此外,我们发现一种多语言现象:指代参与者的构块倾向于比等长度的事件指代构块具有更高的span-overlap得分,这意味着前者在PAS等价句子集合中出现的频率更高。该现象表明这两种构块类型之间存在统计差异,为未来的标记无监督解析研究奠定了基础。

关键词

引用

@article{arxiv.2404.12059,
  title  = {Unsupervised Parsing by Searching for Frequent Word Sequences among Sentences with Equivalent Predicate-Argument Structures},
  author = {Junjie Chen and Xiangheng He and Danushka Bollegala and Yusuke Miyao},
  journal= {arXiv preprint arXiv:2404.12059},
  year   = {2024}
}