使用不同类型的种子词典从可比语料库中提取双语波斯语-意大利语词典
计算与语言
2019-09-23 v2
摘要
双语词典在自然语言处理的各个领域都非常重要。近年来,已有从非平行(可比)语料库中提取新双语词典的研究。几乎都使用一个小规模现有词典或其他资源来制作称为“种子词典”的初始列表。本文中,我们探讨使用不同类型的词典作为从可比语料库创建双语波斯语-意大利语词典的初始起始列表。我们的实验在三种不同的种子词典上应用了最先进的技术:一个现有词典、一个基于枢轴模式创建的词典,以及一个从小型波斯语-意大利语平行文本中提取的词典。我们方法中有趣的挑战是找到一种将不同词典组合在一起以产生更好更准确词典的方法。为了组合种子词典,我们提出了两种不同的组合模型,并检验了我们新颖的组合模型对具有不同可比程度的可比语料库的影响。最后我们提出了一种新的加权系统以改进提取的词典。我们的实现所产生的实验结果显示了所提模型的有效性。
引用
@article{arxiv.1701.08340,
title = {Extracting Bilingual Persian Italian Lexicon from Comparable Corpora Using Different Types of Seed Dictionaries},
author = {Ebrahim Ansari and M. H. Sadreddini and Lucio Grandinetti and Mahsa Radinmehr and Ziba Khosravan and Mehdi Sheikhalishahi},
journal= {arXiv preprint arXiv:1701.08340},
year = {2019}
}
备注
16 pages, accepted to be published in "Applications of Comparable Corpora", Berlin: Language Science Press