基于庞加莱嵌入的名词短语组合性预测
计算与语言
2019-06-10 v1
摘要
多词表达式的组合性程度表明一个短语的意义能在多大程度上由其组成部分的意义及其语法关系推导而来。对(非)组合性的预测是一项频繁使用分布语义模型来解决的任务。我们引入一种新技术,将层次信息与平面分布信息相融合以预测组合性。具体而言,除了分布信息外,我们还使用以最近提出的庞加莱嵌入(Poincaré embeddings)形式编码的多词及其组成部分的上位词信息来检测名词短语的组合性。通过分布相似度与庞加莱相似度函数的加权平均,我们在三个黄金标准数据集上相对于仅基于分布信息的最先进模型取得了稳定且显著的统计性改进。与仅采用无监督设定的传统方法不同,我们还将该问题构建为有监督任务,取得了可媲美的改进。此外,我们公开了我们的庞加莱嵌入,其是在大型语料库上通过手工设计的词汇-句法模式的输出训练的。
引用
@article{arxiv.1906.03007,
title = {On the Compositionality Prediction of Noun Phrases using Poincar\'e Embeddings},
author = {Abhik Jana and Dmitry Puzyrev and Alexander Panchenko and Pawan Goyal and Chris Biemann and Animesh Mukherjee},
journal= {arXiv preprint arXiv:1906.03007},
year = {2019}
}
备注
Accepted in ACL 2019 [Long Paper]