中文

用于句子领域检索的相似度

计算与语言 2020-02-04 v1

摘要

英语。本文旨在研究最佳算法,通过比较多类计算两向量间距离的方法,来验证特定文档是否属于相关领域。此项研究借助Apache Spark框架所提供的结构得以开展。基于Massimiliano Morrelli等人所著出版物《文本分类的新前沿:大数据与分布式计算》中阐述的研究,我们期望开展一项关于可能实现一种能够利用分布式环境计算句子相似度(Similarity)方案的调查研究。意大利语。本文档旨在研究最佳算法,通过对比多种计算两向量间距离的方法,来验证特定文档是否属于相应领域。该研究在Apache Spark框架所提供结构的辅助下完成。从Massimiliano Morrelli等人出版物《文本分类的新前沿:大数据与分布式计算》中阐述的研究出发,我们意在实现对一种能够利用分布式环境计算句子相似度(Similarità)之方案的潜在实现进行研究。

关键词

引用

@article{arxiv.2002.00757,
  title  = {Similarit\`a per la ricerca del dominio di una frase},
  author = {Massimiliano Morrelli and Giacomo Pansini and Massimiliano Polito and Arturo Vitale},
  journal= {arXiv preprint arXiv:2002.00757},
  year   = {2020}
}

备注

in Italian