基于大语言模型的主题建模方法:捕捉研究文献对可持续发展目标的态度
计算与语言
2025-06-09 v2
摘要
世界正面临诸多阻碍人类文明发展和人类福祉的挑战。联合国于 2015 年制定了可持续发展目标(SDGs),旨在到 2030 年应对这些全球挑战。自然语言处理技术有助于揭示研究文献中关于 SDGs 的讨论。我们提出了一种完全自动化的流程:1)从 Scopus 数据库获取内容并构建面向五组 SDGs 的专用数据集;2)执行主题建模——一种用于从大规模文本数据集合中识别主题的统计技术;3)通过基于关键词的搜索和主题频率时间序列提取实现主题探索。在主题建模方面,我们利用扩展至可应用于大规模文本语料库的 BERTopic 栈(在数十万份文档中发现数百个主题),引入 i) 一种新颖的基于大语言模型(LLM)的嵌入计算方法,用于在连续空间中表示科学摘要,以及 ii) 一个超参数优化器,用于高效地为任何新的大规模数据集寻找最佳配置。此外,我们在交互式仪表板上生成了结果可视化,报告主题的时间演化。结果可检查和可探索,有助于主题建模过程的可解释性。我们提出的基于 LLM 的主题建模流程适用于大规模文本数据集,使用户能够捕捉 2006–2023 年时间跨度内科学摘要中对 SDGs 态度的演变。所有结果均可通过我们的系统复现;该工作流程可泛化应用于任何时间点上的任何大规模文本语料库。
引用
@article{arxiv.2411.02943,
title = {Capturing research literature attitude towards Sustainable Development Goals: an LLM-based topic modeling approach},
author = {Francesco Invernici and Francesca Curati and Jelena Jakimov and Amirhossein Samavi and Anna Bernasconi},
journal= {arXiv preprint arXiv:2411.02943},
year = {2025}
}
备注
27 pages, 8 figures, 5 tables