LU-BZU 在 SemEval-2021 任务 2 中的工作:Word2Vec 与 Lemma2Vec 在阿拉伯语上下文词义消歧中的表现
计算与语言
2021-04-19 v1
摘要
本文给出了一系列实验,用于评估和比较在不使用义项库或义项嵌入的情况下,使用 CBOW Word2Vec 与 Lemma2Vec 模型进行阿拉伯语上下文词义(WiC)消歧的性能。作为 SemEval-2021 共享任务 2(WiC 消歧)的一部分,我们使用 dev.ar-ar 数据集(2k 句对)来判断给定句对中的两个词是否具有相同含义。我们使用了两个 Word2Vec 模型:Wiki-CBOW(在阿拉伯语维基百科上预训练)以及我们在约 30 亿词的大规模阿拉伯语语料上训练的模型。还基于这两个 Word2Vec 模型构建了两个 Lemma2Vec 模型。随后将这四个模型分别用于 WiC 消歧任务,并在 SemEval-2021 test.ar-ar 数据集上评估。最后,我们报告了不同模型的性能,并比较了基于词形(lemma)与基于单词(word)的模型的使用差异。
引用
@article{arxiv.2104.08110,
title = {LU-BZU at SemEval-2021 Task 2: Word2Vec and Lemma2Vec performance in Arabic Word-in-Context disambiguation},
author = {Moustafa Al-Hajj and Mustafa Jarrar},
journal= {arXiv preprint arXiv:2104.08110},
year = {2021}
}
备注
Accepted at SemEval 2021 Task 2, 8 Pages (6 Pages main content + 2 pages for references)