DARWIN系列:面向自然科学的领域专用大语言模型
计算与语言
2023-08-29 v1 材料科学
应用物理
摘要
新兴工具为工作带来新方法,自然科学领域亦不例外。在自然科学中,传统人工、串行且劳动密集型的工作正被基于人工智能的实验自动化等驱动的自动化、并行与迭代过程所增强。为在自然科学研究中增添新能力、加速并丰富发现过程的自动化,我们推出DARWIN——一系列面向自然科学(主要为物理学、化学与材料科学)的定制LLM。该系列基于开源LLM,融合了来自公共数据集与文献的结构化及非结构化科学知识。我们使用超过60,000条指令数据点微调模型,强调事实正确性。微调期间,我们引入科学指令生成(SIG)模型,从科学文本中自动生成指令,从而免去人工抽取或领域知识图谱之需,并高效将科学知识注入模型。我们还探索多任务训练策略,揭示科学任务间的内在关联。DARWIN系列不仅在多项科学任务上取得最先进结果,也降低了对闭源AI模型的依赖。本研究展示了LLM在科学领域的能力,总体目标在于促进更广义的AI for Science社区的繁荣。
引用
@article{arxiv.2308.13565,
title = {DARWIN Series: Domain Specific Large Language Models for Natural Science},
author = {Tong Xie and Yuwei Wan and Wei Huang and Zhenyu Yin and Yixuan Liu and Shaozhou Wang and Qingyuan Linghu and Chunyu Kit and Clara Grazian and Wenjie Zhang and Imran Razzak and Bram Hoex},
journal= {arXiv preprint arXiv:2308.13565},
year = {2023}
}