科学文献的文档嵌入:词嵌入与TFIDF的效能比较
人工智能
2021-07-13 v1
摘要
在过去几年中,神经网络导出的词嵌入在自然语言处理文献中变得流行。已开展的研究大多聚焦于在维基百科或其他新闻及社交媒体等公开可用语料上训练的词嵌入的质量与应用。然而,这些研究局限于通用文本,因而缺乏学术语境中常用的技术与科学细微差别,如领域特定词汇、缩写或科学公式。本研究关注词嵌入应用于大规模学术语料的性能。更具体地,我们比较了训练词嵌入与TFIDF表示在建模科学文章内容方面的质量与效率。我们使用在约7000万篇科学文献的标题和摘要上训练的word2vec skip-gram模型。此外,我们开发了一个基准以在科学语境下评估内容模型。该基准基于一个分类任务,将约130万篇2017年发表的文章匹配到期刊。我们的结果表明,基于词嵌入的内容模型对标题(短文本)更好,而TFIDF对摘要(较长文本)效果更好。然而,TFIDF对较大文本的轻微改进是以3.7倍更多内存需求以及高达184倍更高计算时间为代价的,这可能使其对在线应用低效。此外,我们创建了通过嵌入建模的期刊的二维可视化,以定性检查嵌入模型。该图显示了有用的见解,并可用于发现竞争期刊或空白以提议新期刊。
引用
@article{arxiv.2107.05151,
title = {Document Embedding for Scientific Articles: Efficacy of Word Embeddings vs TFIDF},
author = {H. J. Meijer and J. Truong and R. Karimi},
journal= {arXiv preprint arXiv:2107.05151},
year = {2021}
}