连接自然语言处理与心理语言学:基于计算基础的巴斯克语与西班牙语语义相似度数据集
计算与语言
2023-04-21 v2
摘要
我们提出了一个基于两种知名自然语言处理资源(文本语料库与知识库)的计算基础词相似度数据集。该数据集旨在通过提供在词汇加工中起重要作用的变量控制下、广泛名词对集合中多种语义相似度的量化结果,填补心理语言学研究的空白。数据集的创建包含三个步骤:1)计算每个名词的四个关键心理语言学特征——具体性、词频、语义与音系邻域密度;2)跨这四个变量配对名词;3)对每个名词对,赋予三类基于文本、Wordnet和混合嵌入计算的词相似度度量。本数据集包含巴斯克语与欧洲西班牙语的名词对信息,但后续工作拟将其扩展至更多语言。
引用
@article{arxiv.2304.09616,
title = {Bridging Natural Language Processing and Psycholinguistics: computationally grounded semantic similarity datasets for Basque and Spanish},
author = {J. Goikoetxea and M. Arantzeta and I. San Martin},
journal= {arXiv preprint arXiv:2304.09616},
year = {2023}
}