面向社会科学领域的词嵌入评估
计算与语言
2023-02-14 v1
摘要
词嵌入是许多 NLP 任务中的重要工具。大多数可用资源都是在来自 Web 语料库或 Wikipedia 转储的通用语言上训练的。然而,针对特定领域语言的词嵌入较为稀少,尤其是社会科学领域。因此,在这项工作中,我们描述了基于 37,604 篇开放获取的社会科学研究论文创建和评估词嵌入模型的过程。在评估中,我们比较了领域特定模型与通用语言模型在 (i) 语言覆盖度、(ii) 多样性以及 (iii) 语义关系方面的表现。我们发现,所创建的领域特定模型即使词汇量相对较小,也覆盖了大部分社会科学概念,且其邻域相比更通用的模型更为多样。在所有关系类型中,我们发现其对语义关系的覆盖更为广泛。
引用
@article{arxiv.2302.06174,
title = {Evaluation of Word Embeddings for the Social Sciences},
author = {Ricardo Schiffers and Dagmar Kern and Daniel Hienert},
journal= {arXiv preprint arXiv:2302.06174},
year = {2023}
}