中文

面向社会科学领域的词嵌入评估

计算与语言 2023-02-14 v1

摘要

词嵌入是许多 NLP 任务中的重要工具。大多数可用资源都是在来自 Web 语料库或 Wikipedia 转储的通用语言上训练的。然而,针对特定领域语言的词嵌入较为稀少,尤其是社会科学领域。因此,在这项工作中,我们描述了基于 37,604 篇开放获取的社会科学研究论文创建和评估词嵌入模型的过程。在评估中,我们比较了领域特定模型与通用语言模型在 (i) 语言覆盖度、(ii) 多样性以及 (iii) 语义关系方面的表现。我们发现,所创建的领域特定模型即使词汇量相对较小,也覆盖了大部分社会科学概念,且其邻域相比更通用的模型更为多样。在所有关系类型中,我们发现其对语义关系的覆盖更为广泛。

关键词

引用

@article{arxiv.2302.06174,
  title  = {Evaluation of Word Embeddings for the Social Sciences},
  author = {Ricardo Schiffers and Dagmar Kern and Daniel Hienert},
  journal= {arXiv preprint arXiv:2302.06174},
  year   = {2023}
}