MindLLM:从零预训练轻量大语言模型、评测与领域应用
计算与语言
2023-10-31 v2 人工智能
摘要
大语言模型(LLMs)已在各种自然语言任务中展现出卓越性能,标志着向通用人工智能迈出了重大步伐。虽然通用人工智能通过开发日益大规模的模型得以推进,但另一条路径是开发轻量化的定制模型以更好地服务特定领域,同时考虑到训练和部署 LLMs 的高成本以及资源的稀缺性。在本文中,我们提出 MindLLM,一系列从零训练的新型双语轻量大语言模型,通过提供具有 13 亿和 30 亿参数的模型来缓解此类负担。我们给出了大模型的开发过程中积累经验的详尽记述,涵盖流程的每一步,包括数据构建、模型架构、评测与应用。这些见解有望对同行学者和开发者具有价值。MindLLM 在一些公开基准上持续匹配或超越其他开源更大模型的性能。我们还引入了一种为较小模型量身定制的创新指令微调框架,以高效增强其能力。此外,我们探索了 MindLLM 在法律和金融等特定垂直领域的应用,凸显了我们轻量模型的敏捷性与适应性。
引用
@article{arxiv.2310.15777,
title = {MindLLM: Pre-training Lightweight Large Language Model from Scratch, Evaluations and Domain Applications},
author = {Yizhe Yang and Huashan Sun and Jiawei Li and Runheng Liu and Yinghao Li and Yuhang Liu and Heyan Huang and Yang Gao},
journal= {arXiv preprint arXiv:2310.15777},
year = {2023}
}
备注
Working in progress