ROOT13:识别上位词、同下位词与随机词
计算与语言
2016-03-30 v1
摘要
本文中,我们描述ROOT13,一个用于上位词、同下位词和随机词分类的监督系统。该系统依赖于随机森林(Random Forest)算法和13个基于无监督语料的特征。我们使用涉及多个词性(即形容词、名词和动词)的9,600对词进行10折交叉验证评估,这三个类别均匀分布。当所有类别均存在时,ROOT13达到88.3%的F1分数,而基线(向量余弦)为57.6%。当分类为二分类时,ROOT13取得如下结果:上位词-同下位词(93.4% vs. 60.2%)、上位词-随机词(92.3% vs. 65.5%)和同下位词-随机词(97.3% vs. 81.5%)。我们的结果可与state-of-the-art模型竞争。
引用
@article{arxiv.1603.08705,
title = {ROOT13: Spotting Hypernyms, Co-Hyponyms and Randoms},
author = {Enrico Santus and Tin-Shing Chiu and Qin Lu and Alessandro Lenci and Chu-Ren Huang},
journal= {arXiv preprint arXiv:1603.08705},
year = {2016}
}
备注
in AAAI 2016