TechGPT-2.0:一个旨在解决知识图谱构建任务的大型语言模型项目
计算与语言
2024-01-10 v1 人工智能
摘要
大型语言模型在多种自然语言处理任务中展现出强大的性能。本报告介绍 TechGPT-2.0,一个旨在增强大型语言模型在知识图谱构建任务中能力的项目,这些任务包括 NLP 应用中的命名实体识别(NER)和关系三元组抽取(RTE)。此外,它作为一个可供中文开源模型社区研究使用的大语言模型。我们提供两个 7B 大型语言模型权重和一个专门用于处理长文本的 QLoRA 权重。值得注意的是,TechGPT-2.0 在华为昇腾服务器上训练。它继承了 TechGPT-1.0 的所有功能,展现出强大的文本处理能力,尤其在医学和法律领域。此外,我们为模型引入了新的能力,使其能够处理地理区域、交通、组织、文学作品、生物学、自然科学、天体和建筑等多个领域的文本。这些增强也加强了模型处理幻觉、无法回答的查询和长文本的能力。本报告全面详细地介绍了在华为昇腾服务器上进行全量微调的过程,包括昇腾服务器调试、指令微调数据处理和模型训练的经验。我们的代码可在 https://github.com/neukg/TechGPT-2.0 获取。
引用
@article{arxiv.2401.04507,
title = {TechGPT-2.0: A large language model project to solve the task of knowledge graph construction},
author = {Jiaqi Wang and Yuying Chang and Zhong Li and Ning An and Qi Ma and Lei Hei and Haibo Luo and Yifei Lu and Feiliang Ren},
journal= {arXiv preprint arXiv:2401.04507},
year = {2024}
}