中文

基于领域特定词嵌入与主题建模的科技文献分析

计算与语言 2021-12-28 v1 人工智能

摘要

科学界正以飞快的速度发生变化,新技术不断被开发,新趋势以越来越高的频率出现。本文提出一个用于学术出版物科学分析的框架,这对监测研究趋势和识别潜在创新至关重要。该框架采用并融合了自然语言处理的多种技术,如词嵌入和主题建模。词嵌入用于捕捉领域特定词的语义。我们提出两种新颖的科技文献嵌入,即 PUB-G 和 PUB-W,它们能够学习各个研究领域中通用词以及领域特定词的语义。此后,利用主题建模在这些较大的研究领域中识别研究主题的簇。我们整理了一个出版物数据集,包含来自两个研究领域的两个会议和两个期刊从1995年到2020年的文献。实验结果表明,基于主题一致性,我们的 PUB-G 和 PUB-W 嵌入相比其他基线嵌入有约0.18-1.03的优势。

关键词

引用

@article{arxiv.2112.12940,
  title  = {Analyzing Scientific Publications using Domain-Specific Word Embedding and Topic Modelling},
  author = {Trisha Singhal and Junhua Liu and Lucienne T. M. Blessing and Kwan Hui Lim},
  journal= {arXiv preprint arXiv:2112.12940},
  year   = {2021}
}

备注

Accepted at the 2021 IEEE International Conference on Big Data (BigData2021)