HoneyBee:面向材料科学的大语言模型渐进式指令微调
计算与语言
2023-10-13 v1 材料科学
人工智能
摘要
我们提出一种基于指令的材料科学可信数据整理流程(MatSci-Instruct),并随后将其应用于微调一个面向材料科学的基于 LLaMa 的语言模型(HoneyBee)。MatSci-Instruct 有助于缓解开放文献中相关的、高质量材料科学文本数据的稀缺性,而 HoneyBee 是首个专门面向材料科学的十亿参数语言模型。在 MatSci-Instruct 中,我们通过提示多个可商用的现成大语言模型,由一个 Instructor 模块(如 Chat-GPT)生成、并由一个独立的 Verifier 模块(如 Claude)验证,来提高生成数据的可信度。利用 MatSci-Instruct,我们构建了多任务数据集,并沿多个维度衡量数据集质量,包括针对已知事实的准确性、与材料科学的相关性,以及数据的完整性与合理性。此外,我们在微调-评估-反馈循环中迭代生成更具针对性的指令与指令数据,从而使微调后的 HoneyBee 模型性能逐步提升。我们在 MatSci-NLP 基准上的评估显示,HoneyBee 在材料科学任务上优于现有语言模型,并在指令数据精炼的连续阶段中迭代改进。我们通过自动评估研究 HoneyBee 语言建模的质量,并分析案例以进一步理解模型的能力与局限。我们的代码和相关数据集公开于 \url{https://github.com/BangLab-UdeM-Mila/NLP4MatSci-HoneyBee}。
引用
@article{arxiv.2310.08511,
title = {HoneyBee: Progressive Instruction Finetuning of Large Language Models for Materials Science},
author = {Yu Song and Santiago Miret and Huan Zhang and Bang Liu},
journal= {arXiv preprint arXiv:2310.08511},
year = {2023}
}