中文

一种用于丰富阿拉伯语同义词的基准与评分算法

计算与语言 2023-02-09 v1

摘要

本文处理的任务是扩展给定的同义词集,添加额外的同义词,并将同义强度视为一个模糊值。给定一个单语/多语同义词集和一个阈值(一个模糊值 [0-1]),我们的目标是从现有词典中提取高于此阈值的新同义词。我们提出了双重贡献:一个算法和一个基准数据集。该数据集包含 500 个同义词集的 3K 个候选同义词。每个候选同义词都由四位语言学家用模糊值进行了标注。该数据集的重要性在于:(i) 理解语言学家在同义关系上的(不)一致程度,以及 (ii) 使用该数据集作为评估我们算法的基线。我们提出的算法从现有词典中提取同义词,并为每个候选词计算一个模糊值。我们的评估表明,该算法的行为类似于一位语言学家,并且其模糊值接近语言学家提出的值(使用 RMSE 和 MAE 衡量)。该数据集和一个演示页面可在 https://portal.sina.birzeit.edu/synonyms 公开获取。

关键词

引用

@article{arxiv.2302.02232,
  title  = {A Benchmark and Scoring Algorithm for Enriching Arabic Synonyms},
  author = {Sana Ghanem and Mustafa Jarrar and Radi Jarrar and Ibrahim Bounhas},
  journal= {arXiv preprint arXiv:2302.02232},
  year   = {2023}
}