LlaSMol:利用大规模、全面、高质量的指令微调数据集推进化学领域大型语言模型
人工智能
2024-08-13 v4 计算工程、金融与科学
计算与语言
摘要
化学在药物发现和材料科学等许多领域发挥着至关重要的作用。虽然大型语言模型(LLMs)如GPT-4在自然语言处理任务上表现出卓越的能力,但现有研究表明它们在化学任务上的性能令人沮丧地低。然而,在本文中,我们证明我们开发的LLMs可以在全面的化学任务集上取得非常强的结果,大幅超越最先进的GPT-4和Claude 3 Opus。为了实现这一点,我们提出了SMolInstruct,一个大规模、全面、高质量的指令微调数据集。它包含14个选定的化学任务和超过三百万个样本,为训练和评估化学LLMs奠定了坚实的基础。使用SMolInstruct,我们微调了一组开源LLMs,其中我们发现Mistral是化学任务的最佳基础模型。我们的分析进一步证明了所提出的数据集在推动性能改进中的关键作用。
引用
@article{arxiv.2402.09391,
title = {LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset},
author = {Botao Yu and Frazier N. Baker and Ziqi Chen and Xia Ning and Huan Sun},
journal= {arXiv preprint arXiv:2402.09391},
year = {2024}
}
备注
Accepted by COLM 2024