FoodGPT:融合增量预训练与知识图谱提示的食品检测领域大语言模型
计算与语言
2023-08-22 v1
摘要
当前,特定领域大语言模型的构建通过在基础模型上微调完成。部分模型还引入了知识库而无需预训练,这是因为基础模型在预训练过程中已包含领域特定知识。我们构建了一个面向食品检测的大语言模型。与上述方法不同,该领域大量数据以领域标准文档的扫描格式存在,此外还有大量未经训练的结构化知识。因此,我们引入增量预训练步骤以将这些知识注入大语言模型。本文提出一种在增量预训练中处理结构化知识与扫描文档的方法。为克服机器幻觉问题,我们构建了知识图谱作为外部知识库以支持大语言模型中的检索。值得一提的是,本文为我们预发布版本的技术报告,具体实验数据将在未来版本中汇报。
引用
@article{arxiv.2308.10173,
title = {FoodGPT: A Large Language Model in Food Testing Domain with Incremental Pre-training and Knowledge Graph Prompt},
author = {Zhixiao Qi and Yijiong Yu and Meiqi Tu and Junyi Tan and Yongfeng Huang},
journal= {arXiv preprint arXiv:2308.10173},
year = {2023}
}