当赫斯特模式不足时:利用分布模型改进语料库中的上下位关系检测
计算与语言
2020-10-13 v1
摘要
我们借助大规模文本语料库解决上下位关系检测问题,即判断词对 (x, y) 之间是否存在“是一种”(is-a) 关系。该任务的大多数传统方法被归类为基于模式的方法或基于分布的方法。近期研究表明,若提取并输入大规模 Hearst 词对,且缓解了未见 (x, y) 词对的稀疏性,则基于模式的方法更优。然而,在某些特定的稀疏性情形下它们会失效,即 x 或 y 未参与任何模式。本文首次量化了这些特定情形不可忽略的存在性。我们还证明在此类情形下分布方法恰好能弥补基于模式方法的不足。我们设计了一个互补框架,在该框架下,基于模式与基于分布的模型在各自擅长的情形中无缝协作。在多个基准数据集上,我们的框架取得了有竞争力的提升,且案例研究显示了其更好的可解释性。
引用
@article{arxiv.2010.04941,
title = {When Hearst Is not Enough: Improving Hypernymy Detection from Corpus with Distributional Models},
author = {Changlong Yu and Jialong Han and Peifeng Wang and Yangqiu Song and Hongming Zhang and Wilfred Ng and Shuming Shi},
journal= {arXiv preprint arXiv:2010.04941},
year = {2020}
}
备注
Accepted by EMNLP2020 Main Conference