波斯语文本中的词表示与词嵌入
计算与语言
2017-12-20 v1
摘要
文本处理是自然语言处理的子分支之一。近来,机器学习与神经网络方法的使用受到更多关注。因此,词的表示变得非常重要。本文关注波斯语文本中的词表示或将词转换为向量的问题。在本研究中,GloVe、CBOW 和 skip-gram 方法被改进以生成波斯语词的嵌入向量。为了训练神经网络,我们将 Bijankhan 语料库、Hamshahri 语料库和 UPEC 语料库合并使用。最终,我们得到了 342,362 个词,这些词在所有三种模型中均获得了向量。这些向量在波斯语自然语言处理中有许多用途。
引用
@article{arxiv.1712.06674,
title = {word representation or word embedding in Persian text},
author = {Siamak Sarmady and Erfan Rahmani},
journal= {arXiv preprint arXiv:1712.06674},
year = {2017}
}