中文

LU-BZU 在 SemEval-2021 任务 2 中的工作:Word2Vec 与 Lemma2Vec 在阿拉伯语上下文词义消歧中的表现

计算与语言 2021-04-19 v1

摘要

本文给出了一系列实验,用于评估和比较在不使用义项库或义项嵌入的情况下,使用 CBOW Word2Vec 与 Lemma2Vec 模型进行阿拉伯语上下文词义(WiC)消歧的性能。作为 SemEval-2021 共享任务 2(WiC 消歧)的一部分,我们使用 dev.ar-ar 数据集(2k 句对)来判断给定句对中的两个词是否具有相同含义。我们使用了两个 Word2Vec 模型:Wiki-CBOW(在阿拉伯语维基百科上预训练)以及我们在约 30 亿词的大规模阿拉伯语语料上训练的模型。还基于这两个 Word2Vec 模型构建了两个 Lemma2Vec 模型。随后将这四个模型分别用于 WiC 消歧任务,并在 SemEval-2021 test.ar-ar 数据集上评估。最后,我们报告了不同模型的性能,并比较了基于词形(lemma)与基于单词(word)的模型的使用差异。

关键词

引用

@article{arxiv.2104.08110,
  title  = {LU-BZU at SemEval-2021 Task 2: Word2Vec and Lemma2Vec performance in Arabic Word-in-Context disambiguation},
  author = {Moustafa Al-Hajj and Mustafa Jarrar},
  journal= {arXiv preprint arXiv:2104.08110},
  year   = {2021}
}

备注

Accepted at SemEval 2021 Task 2, 8 Pages (6 Pages main content + 2 pages for references)