中文

SciLitLLM:如何为科学文献理解定制大语言模型

机器学习 2025-04-21 v5 计算与语言

摘要

科学文献理解对于提取目标信息和获取见解至关重要,从而显著推动科学发现。尽管大型语言模型(LLMs)在科学文献理解方面取得了显著的成功,但它们仍面临主要由于(1)缺乏科学知识和(2)不熟悉专门的科学任务。为了开发专为科学文献理解而设计的LLM,我们提出了一种混合策略,集成持续预训练(CPT)和监督式微调(SFT),以同时灌注科学领域知识并增强针对特定领域任务的指令遵循能力。在此过程中,我们确定了两个关键挑战:(1)构建高质量的CPT语料库,(2)生成多样化的SFT指令。我们通过严谨的管道,包括PDF文本提取、内容错误纠正、质量筛选和合成指令创建来解决这些挑战。应用这一策略,我们提出了一套LLM:SciLitLLM,专为科学文献理解而设计。这些模型在科学文献理解基准测试上表现出有前景的性能。我们的贡献有三个:(1)我们提出了一种有效的框架,将CPT和SFT集成以适应科学文献理解,这种方法也可以轻松适用于其他领域。(2)我们提出了一种基于LLM的合成方法,用于生成多样且高质量的科学指令, resulting in a new instruction set -- SciLitIns -- for supervised fine-tuning in less-represented scientific domains. (3)SciLitLLM在科学文献理解基准测试上实现了有前景的性能提升。

关键词

引用

@article{arxiv.2408.15545,
  title  = {SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding},
  author = {Sihang Li and Jin Huang and Jiaxi Zhuang and Yaorui Shi and Xiaochen Cai and Mingjun Xu and Xiang Wang and Linfeng Zhang and Guolin Ke and Hengxing Cai},
  journal= {arXiv preprint arXiv:2408.15545},
  year   = {2025}
}

备注

ICLR 2025