基于知识的语言学标注对科学词嵌入质量的影响
计算与语言
2021-04-14 v1
摘要
本质上,嵌入算法通过优化词与其通常上下文之间的距离来生成编码词分布表示的嵌入空间。除单个词或词片外,由文本语言学分析产生的其他特征,包括词汇、语法和语义信息,可用于改善嵌入空间的质量。然而,迄今为止我们尚未精确理解此类个体标注及其可能组合对嵌入质量的影响。在本文中,我们对使用显式语言学标注从科学语料库生成嵌入并量化其对所得表示的影响进行了全面研究。我们的结果表明,此类标注在嵌入中的效果因评估任务而异。总体而言,我们观察到使用语言学标注学习嵌入有助于取得更好的评估结果。
引用
@article{arxiv.2104.06200,
title = {On the Impact of Knowledge-based Linguistic Annotations in the Quality of Scientific Embeddings},
author = {Andres Garcia-Silva and Ronald Denaux and Jose Manuel Gomez-Perez},
journal= {arXiv preprint arXiv:2104.06200},
year = {2021}
}
备注
Accepted for publication in Future Generation Computer Systems