一种基于深度学习的波斯语文本领域相似度度量方法
计算与语言
2019-09-27 v2 人工智能
机器学习
机器学习
摘要
本文提出一种新方法,用于度量两段波斯语文本的类别相似程度,这两段文本作为两条独立广告的描述发布。我们利用一个由某电子商务网站发布的广告组成的数据集,为该项工作构建了合适的 dataset。我们从该数据集中生成了大量成对文本,并为每对文本赋予 0 到 3 的分数,以表示其领域间的相似程度。在本工作中,我们使用源自 word2vec 的词嵌入向量表示单词,随后利用深度神经网络模型表示文本。最终,我们采用绝对差与按位乘法的拼接以及一个全连接神经网络,为文本对的分数生成概率分布向量。通过监督学习方法,我们在 GPU 上训练了模型,最佳模型取得了 0.9865 的 F1 分数。
引用
@article{arxiv.1909.09690,
title = {A Deep Learning-Based Approach for Measuring the Domain Similarity of Persian Texts},
author = {Hossein Keshavarz and Shohreh Tabatabayi Seifi and Mohammad Izadi},
journal= {arXiv preprint arXiv:1909.09690},
year = {2019}
}