SimRelUz:作为乌兹别克语语义评估数据集的相似度与关联度评分
计算与语言
2022-05-13 v1
摘要
词语之间的语义关联是自然语言处理的核心概念之一,因此语义评估是一项重要任务。在本文中,我们提出一个语义模型评估数据集:SimRelUz——一个面向低资源乌兹别克语的词语对相似度与关联度评分集合。该数据集由一千多对词语组成,这些词语根据其形态特征、出现频率、语义关系精心筛选,并由来自不同年龄段和性别的十一位乌兹别克语母语者标注。我们还关注了处理罕见词与词汇表外词的问题,以全面评估语义模型的鲁棒性。
引用
@article{arxiv.2205.06072,
title = {SimRelUz: Similarity and Relatedness scores as a Semantic Evaluation dataset for Uzbek language},
author = {Ulugbek Salaev and Elmurod Kuriyozov and Carlos Gómez-Rodríguez},
journal= {arXiv preprint arXiv:2205.06072},
year = {2022}
}
备注
Final version, published in the proceedings of SIGUL workshop of LREC 2022