中文

一种基于深度学习的波斯语文本领域相似度度量方法

计算与语言 2019-09-27 v2 人工智能 机器学习 机器学习

摘要

本文提出一种新方法,用于度量两段波斯语文本的类别相似程度,这两段文本作为两条独立广告的描述发布。我们利用一个由某电子商务网站发布的广告组成的数据集,为该项工作构建了合适的 dataset。我们从该数据集中生成了大量成对文本,并为每对文本赋予 0 到 3 的分数,以表示其领域间的相似程度。在本工作中,我们使用源自 word2vec 的词嵌入向量表示单词,随后利用深度神经网络模型表示文本。最终,我们采用绝对差与按位乘法的拼接以及一个全连接神经网络,为文本对的分数生成概率分布向量。通过监督学习方法,我们在 GPU 上训练了模型,最佳模型取得了 0.9865 的 F1 分数。

关键词

引用

@article{arxiv.1909.09690,
  title  = {A Deep Learning-Based Approach for Measuring the Domain Similarity of Persian Texts},
  author = {Hossein Keshavarz and Shohreh Tabatabayi Seifi and Mohammad Izadi},
  journal= {arXiv preprint arXiv:1909.09690},
  year   = {2019}
}