中文

利用邻域分布散度进行无监督完全成分句法分析

计算与语言 2021-11-01 v1

摘要

无监督成分句法分析已被广泛探索,但仍远未解决。传统的无监督成分句法分析器只能捕捉句子的无标号结构。面向无监督完全成分句法分析,我们提出一种无监督且无训练的标注过程,利用最近引入的度量邻域分布散度(NDD)的性质,该度量评估编辑前后句子间的语义相似性。为实现之,我们将 NDD 发展为双词性 NDD(DP-NDD)并构建“模板”以检测句子中的成分及其标号。我们表明 DP-NDD 不仅精确标注成分,而且以更简单的规则归纳出比以往所有无监督方法更准确的无标号成分树。借助两种用于标号成分树推断的框架,我们在无标号 F1 上确立了新的最优结果,并为标号 F1 提供了强基线。与传统的预测-评估场景相反,我们的方法作为一个合理示例,逆向地将评估度量用于预测。

关键词

引用

@article{arxiv.2110.15931,
  title  = {Unsupervised Full Constituency Parsing with Neighboring Distribution Divergence},
  author = {Letian Peng and Zuchao Li and Hai Zhao},
  journal= {arXiv preprint arXiv:2110.15931},
  year   = {2021}
}