GeoGalactica: 地球科学领域的大型科学语言模型
计算与语言
2024-04-16 v2
摘要
大型语言模型(LLMs)因其通用知识和解决自然语言处理(NLP)中广泛任务的能力而取得了巨大成功。由于其令人印象深刻的能力,LLMs为通过人工智能促进特定领域的科学发现(AI for Science, AI4S)的潜在跨学科应用带来了希望。同时,在地球科学研究和实践中利用NLP技术是广泛而复杂的,涉及从知识提取和文档分类到问答和知识发现。在这项工作中,我们通过一种相当直接的方法,迈出了利用LLM进行科学研究的初步步骤。我们尝试将LLM专门用于地球科学,通过使用大量地球科学文本进一步预训练模型,以及使用我们自定义收集的指令微调数据集对所得模型进行监督微调(SFT)。这些努力产生了包含300亿参数的模型GeoGalactica。据我们所知,它是地球科学领域最大的语言模型。更具体地说,GeoGalactica来自对Galactica的进一步预训练。我们在包含650亿个token的地球科学相关文本语料库上训练GeoGalactica,保留了最大的地球科学专用文本语料库。然后,我们使用100万对指令微调数据(包含需要专业地球科学知识才能回答的问题)对模型进行微调。在本技术报告中,我们将详细说明GeoGalactica的所有方面,包括数据收集、数据清洗、基座模型选择、预训练、SFT和评估。我们开源了数据整理工具以及预训练前3/4阶段的GeoGalactica检查点。
引用
@article{arxiv.2401.00434,
title = {GeoGalactica: A Scientific Large Language Model in Geoscience},
author = {Zhouhan Lin and Cheng Deng and Le Zhou and Tianhang Zhang and Yi Xu and Yutong Xu and Zhongmou He and Yuanyuan Shi and Beiya Dai and Yunchong Song and Boyi Zeng and Qiyuan Chen and Yuxun Miao and Bo Xue and Shu Wang and Luoyi Fu and Weinan Zhang and Junxian He and Yunqiang Zhu and Xinbing Wang and Chenghu Zhou},
journal= {arXiv preprint arXiv:2401.00434},
year = {2024}
}