随机森林中用于学习分类语义关系的九个特征
计算与语言
2016-03-30 v1
摘要
ROOT9 是一个用于分类上位词、同下位词和随机词的监督系统,派生自已提出的 ROOT13 (Santus et al., 2016)。它依赖于随机森林(Random Forest)算法和九个基于无监督语料库的特征。我们通过 10 折交叉验证在 9,600 对词项上对其进行评估,这些词对在三类中均匀分布,并涉及若干词性(即形容词、名词和动词)。当所有类均存在时,ROOT9 取得 90.7% 的 F1 分数,而基线(向量余弦)为 57.2%。当分类为二分类时,ROOT9 相对于基线取得如下结果:上位词-同下位词 95.7% 对 69.8%,上位词-随机词 91.8% 对 64.1%,同下位词-随机词 97.8% 对 79.4%。为与最先进性能比较,我们还在 Weeds et al. (2014) 数据集的子集上评估了 ROOT9,证明其确实具有竞争力。最后,我们探究了该系统是学习了语义关系,还是如 Levy et al. (2015) 所声称的那样仅仅学习了原型上位词。第二种可能性似乎最大,尽管 ROOT9 可通过对负例(即交换的上位词)训练来大幅降低此偏差。
引用
@article{arxiv.1603.08702,
title = {Nine Features in a Random Forest to Learn Taxonomical Semantic Relations},
author = {Enrico Santus and Alessandro Lenci and Tin-Shing Chiu and Qin Lu and Chu-Ren Huang},
journal= {arXiv preprint arXiv:1603.08702},
year = {2016}
}
备注
in LREC 2016