中文

用于改进阿拉伯语目标词义验证的上下文-释义增强

计算与语言 2023-02-09 v1

摘要

阿拉伯语缺乏语义数据集与词义词典。阿拉伯语最常见的语义标注数据集是ArabGlossBERT,这是一个相对较小的数据集,包含从阿拉伯语词典收集的167K上下文-释义对(约60K正例与107K负例)。本文通过对ArabGlossBERT数据集使用(阿拉伯语-英语-阿拉伯语)机器回译进行增强,丰富了该数据集。增强将数据集规模扩大至352K对(149K正例与203K负例)。我们使用不同数据配置来衡量增强的影响,以在目标词义验证(TSV)任务上微调BERT。总体而言,不同数据配置下准确率介于78%至84%。尽管我们的方法与基线表现相当,但在部分实验中的一些词性(POS)标签上确实观察到了改进。此外,我们的微调模型在覆盖更大词汇量与上下文的更大数据集上训练。我们提供了对每个词性(POS)准确率的深入分析。

关键词

引用

@article{arxiv.2302.03126,
  title  = {Context-Gloss Augmentation for Improving Arabic Target Sense Verification},
  author = {Sanad Malaysha and Mustafa Jarrar and Mohammed Khalilia},
  journal= {arXiv preprint arXiv:2302.03126},
  year   = {2023}
}