SciTopic:通过高级 LLM 提升科学文献主题发现
计算与语言
2025-11-10 v2
摘要
科学文献主题发现为研究人员提供宝贵的洞见,帮助识别新兴趋势并探索新的研究方向,促进科学信息检索。许多机器学习方法,特别是深度嵌入技术,已被应用于发现研究主题。然而,大多数现有主题发现方法依赖于词嵌入来捕捉语义,缺乏对科学出版物的全面理解,难以处理复杂的高维文本关系。灵感来自大型语言模型 (LLM) 对文本信息的卓越理解能力,我们提出一种通过 LLM 提供支持以提高科学主题识别的高级主题发现方法,称为 SciTopic。具体而言,我们首先构建一个文本编码器来捕捉科学出版物中的内容,包括元数据、标题和摘要。随后,我们构建一个空间优化模块,将熵基准采样和由 LLM 引导的三元组任务相结合,增强对主题相关性和模糊实例之间的情境细节的关注。然后,我们提出在 LLM 的指导下对文本编码器进行微调,通过优化三元组的对比损失,迫使文本编码器更好地区分不同主题的实例。最后,在三个真实世界的科学出版物数据集上进行的大量实验表明,SciTopic 优于最先进 (SOTA) 的科学主题发现方法,使研究人员能够获得更深入、更快的洞见。
引用
@article{arxiv.2508.20514,
title = {SciTopic: Enhancing Topic Discovery in Scientific Literature through Advanced LLM},
author = {Pengjiang Li and Zaitian Wang and Xinhao Zhang and Ran Zhang and Lu Jiang and Pengfei Wang and Yuanchun Zhou},
journal= {arXiv preprint arXiv:2508.20514},
year = {2025}
}