Jellyfish:用于数据预处理的大语言模型
人工智能
2024-10-30 v6 计算与语言
数据库
机器学习
摘要
本文探讨了大语言模型(LLM)在数据预处理(DP)中的应用,数据预处理是数据挖掘流程中将原始数据转换为易于处理的干净格式的关键步骤。尽管使用大语言模型为数据预处理设计通用解决方案引发了广泛兴趣,但该领域近期的研究通常依赖于 GPT API,不可避免地引发了数据泄露的担忧。与这些方法不同,我们考虑对本地大语言模型(7--13B 模型)进行指令微调,将其作为可在本地、单块且低成本的 GPU 上运行的通用数据预处理任务求解器,从而确保数据安全并支持进一步的定制化。我们选取了涵盖四个代表性数据预处理任务的数据集集合,并采用针对数据预处理量身定制的数据配置、知识注入和推理数据蒸馏技术构建指令微调数据。通过对 Mistral-7B、Llama 3-8B 和 OpenOrca-Platypus2-13B 进行微调,我们的模型(即 Jellyfish-7B/8B/13B)在与 GPT-3.5/4 模型的对比中表现出竞争力,并对未见过的任务具有强大的泛化能力,同时几乎不会损害基座模型在自然语言处理任务上的能力。同时,与 GPT-3.5 相比,Jellyfish 具备更强的推理能力。我们的模型可在以下网址获取:https://huggingface.co/NECOUDBFM/Jellyfish 。我们的指令数据集可在以下网址获取:https://huggingface.co/datasets/NECOUDBFM/Jellyfish-Instruct 。
引用
@article{arxiv.2312.01678,
title = {Jellyfish: A Large Language Model for Data Preprocessing},
author = {Haochen Zhang and Yuyang Dong and Chuan Xiao and Masafumi Oyamada},
journal= {arXiv preprint arXiv:2312.01678},
year = {2024}
}
备注
Accepted by EMNLP 2024, a.k.a. "Jellyfish: Instruction-Tuning Local Large Language Models for Data Preprocessing''