中文

书呆子!在 ESL 和 TOEFL 数据集上击败学生与向量余弦

计算与语言 2016-03-30 v1

摘要

在本文中,我们主张,通常被认为是向量空间模型中识别词语相似度最高效的无监督度量之一的向量余弦(Vector Cosine),可以被一种完全无监督的度量超越;该度量评估两个目标词的最相关上下文之间的交集程度,并根据共享上下文在依存排序列表中的排名对该交集加权。这一主张源于如下假设:相似词不仅简单地出现在相似上下文中,而且与其他相关词相比,它们共享了更大比例的最相关上下文。为证明这一点,我们描述并评估了 APSyn——平均精度(Average Precision)的一种变体,它无论采用何种参数,在 ESL 和 TOEFL 测试集上均优于向量余弦与共现。在最佳设置下,APSyn 在 ESL 数据集上达到 0.73 准确率,在 TOEFL 数据集上达到 0.70 准确率,从而击败了非英语美国大学申请者(据文献报道其平均值为 64.50%)以及若干最先进方法。

关键词

引用

@article{arxiv.1603.08701,
  title  = {What a Nerd! Beating Students and Vector Cosine in the ESL and TOEFL Datasets},
  author = {Enrico Santus and Tin-Shing Chiu and Qin Lu and Alessandro Lenci and Chu-Ren Huang},
  journal= {arXiv preprint arXiv:1603.08701},
  year   = {2016}
}

备注

in LREC 2016