一种用于丰富阿拉伯语同义词的基准与评分算法
计算与语言
2023-02-09 v1
摘要
本文处理的任务是扩展给定的同义词集,添加额外的同义词,并将同义强度视为一个模糊值。给定一个单语/多语同义词集和一个阈值(一个模糊值 [0-1]),我们的目标是从现有词典中提取高于此阈值的新同义词。我们提出了双重贡献:一个算法和一个基准数据集。该数据集包含 500 个同义词集的 3K 个候选同义词。每个候选同义词都由四位语言学家用模糊值进行了标注。该数据集的重要性在于:(i) 理解语言学家在同义关系上的(不)一致程度,以及 (ii) 使用该数据集作为评估我们算法的基线。我们提出的算法从现有词典中提取同义词,并为每个候选词计算一个模糊值。我们的评估表明,该算法的行为类似于一位语言学家,并且其模糊值接近语言学家提出的值(使用 RMSE 和 MAE 衡量)。该数据集和一个演示页面可在 https://portal.sina.birzeit.edu/synonyms 公开获取。
引用
@article{arxiv.2302.02232,
title = {A Benchmark and Scoring Algorithm for Enriching Arabic Synonyms},
author = {Sana Ghanem and Mustafa Jarrar and Radi Jarrar and Ibrahim Bounhas},
journal= {arXiv preprint arXiv:2302.02232},
year = {2023}
}