中文

PubMed语料上的Doc2Vec:一种生成相关文章新方法的研究

计算与语言 2019-11-27 v1 信息检索

摘要

PubMed是全球最大且使用最广泛的书目数据库,收录了超过2600万篇生物医学出版物。其有用功能之一是“相似文章”板块,使终端用户能够找到在语境上与所查阅文档相关联的科学文章。本研究的目的是分析是否可以用文档嵌入方法替代统计模型PubMed相关文章(pmra)。使用Doc2Vec算法训练允许将文档向量化的模型。通过网格搜索策略优化其六个参数,训练了超过1900个模型。导致最佳准确率的参数组合被用于在与PubMed数据库摘要上训练模型。定义了四项评估任务以确定Doc2Vec和pmra中文档间邻近性受何种因素影响或不受影响。两种不同Doc2Vec架构在关联具有共同语境的文档方面能力不同。在术语标引、词和词干内容方面,pmra与Doc2Vec PV-DBOW架构所关联文档高度相似。这些算法也更可能将大小相似的文档拉近。相反,人工评估显示pmra算法结果好得多。虽然pmra算法通过在其公式中显式使用术语标引来关联文档,Doc2Vec不需要先验标引。它可以在没有任何关于它们的知识的情况下推断共享相似标引的文档间关系,尤其是关于PV-DBOW架构。相反,人工评估在评估者之间无明确一致,意味着未来研究需更好理解PV-DBOW与pmra算法间的这一差异。

关键词

引用

@article{arxiv.1911.11698,
  title  = {Doc2Vec on the PubMed corpus: study of a new approach to generate related articles},
  author = {Emeric Dynomant and Stéfan J. Darmoni and Émeline Lejeune and Gaëtan Kerdelhué and Jean-Philippe Leroy and Vincent Lequertier and Stéphane Canu and Julien Grosjean},
  journal= {arXiv preprint arXiv:1911.11698},
  year   = {2019}
}