基于大型语言模型的出版物趋势分析与综合:来自 PNAS 工程学案例研究
数字图书馆
2025-10-21 v1 人工智能
计算与语言
机器学习
摘要
科学文献因复杂语言、静态学科结构以及可能稀疏的关键词系统而日益被划分,使得捕捉现代科学的动态特性变得繁琐。本研究通过引入一种可适应的大型语言模型(LLM)驱动框架,对科学主题趋势进行量化,并绘制其知识演化格局的图景。该方法通过对超过 1500 篇发表于《美国国家学院院士杂志》(PNAS)的工程类文章进行分析,这些文章因其研究范围广泛和深度深入而具有代表性。首先,采用两阶段分类管道,基于文章摘要建立其主要主题类别。随后,进行全文分析以分配次要分类,从而揭示语料库中潜在的、跨主题的联系。传统自然语言处理(NLP)方法,如词袋模型(Bag-of-Words, BoW)和术语频率-逆文档频率(TF-IDF),确认了所得主题结构,也表明独立的词频分析可能不足以映射高度多样性的学科领域。最后,一种主要分类与次要分类之间的无关图表示揭示了当仅分析摘要或关键词时不太明显的主题之间的隐式联系。研究结果表明,该方法能够独立恢复大量期刊编辑器嵌入的结构,而无需了解其现有的双分类方案(例如,生物学研究也被归类为工程学)。该框架为检测潜在主题趋势并提供科学进展的宏观概览提供了强大的工具。
引用
@article{arxiv.2510.16152,
title = {Publication Trend Analysis and Synthesis via Large Language Model: A Case Study of Engineering in PNAS},
author = {Mason Smetana and Lev Khazanovich},
journal= {arXiv preprint arXiv:2510.16152},
year = {2025}
}
备注
35 pages, 10 figures