Xiwu:一种面向高能物理的基础模型灵活可学习 LLM
高能物理 - 唯象学
2024-04-15 v1 人工智能
计算与语言
机器学习
高能物理 - 实验
计算物理
摘要
大型语言模型(LLM)正经历一段快速更新与变革的时期,最先进的(SOTA)模型频繁被替代。将 LLM 应用于特定科学领域时,在获取独特领域知识的同时保持模型本身的先进性是一项挑战。为应对这一挑战,我们开发了一套名为 Xiwu 的复杂大型语言模型系统,允许用户在最先进的基础模型之间进行切换,并快速向模型传授领域知识。在本工作中,我们将报告 LLM 在高能物理(HEP)领域应用的最佳实践,包括:提出了一种种子裂变技术,并开发了多种数据收集与清洗工具,以快速获取领域内 AI-Ready 数据集;基于向量存储技术实现了一套即时学习系统;开发了一套即时微调系统,以促进在特定基础模型下的快速训练。结果表明,Xiwu 能够在 LLaMA、Vicuna、ChatGLM 和 Grok-1 等基础模型之间平滑切换。经过训练的 Xiwu 模型在 HEP 知识问答与代码生成方面显著优于基准模型。该策略显著增强了我们模型性能增长的潜力,有望随着开源模型的发展演进超越 GPT-4。这项工作为 HEP 领域提供了一套定制化的 LLM,同时也为将 LLM 应用于其他领域提供了参考,相应代码已在 Github 上公开。
引用
@article{arxiv.2404.08001,
title = {Xiwu: A Basis Flexible and Learnable LLM for High Energy Physics},
author = {Zhengde Zhang and Yiyu Zhang and Haodong Yao and Jianwen Luo and Rui Zhao and Bo Huang and Jiameng Zhao and Yipu Liao and Ke Li and Lina Zhao and Jun Cao and Fazhi Qi and Changzheng Yuan},
journal= {arXiv preprint arXiv:2404.08001},
year = {2024}
}
备注
15 pages, 8 figures