中文

基于比例定律的监督式微调数据标注

计算与语言 2024-08-19 v2

摘要

本文引入一种通过比例定律校准的多阶段手动标注方法,为资源受限环境(如GPU不足、GPT访问受限、资金受限)下的高质量监督式微调(SFT)数据获取方法。我们预处理了58k条真实对话数据,手动标注了2.3k个问题。随后,我们在0.5B至32B参数的Qwen模型上进行微调。最佳版本在F1分数上提升了29.07分。这一结果确认了为下游自然语言处理(NLP)任务对大语言模型(LLM)进行微调的可行性。我们的贡献包括:1)创建了以alpaca格式为SFT训练数据的,以及一套低秩适应(LoRA)权重;2)开发了一种利用比例定律原则获取高质量数据的的方法。该脚本、原始数据(alpaca格式)和实验记录已在Github(https://github.com/InternLM/HuixiangDou/tree/main/web/tools)、HuggingFace(https://huggingface.co/tpoisonooo)和WandB(https://wandb.ai/tpoisonooo/huixiangdou-cr/table?nw=nwusertpoisonooo)公开。所涉及数据的隐私已获用户授权。SFT数据和许可证来自ncnn贡献者组织。

关键词

引用

@article{arxiv.2405.02817,
  title  = {Labeling supervised fine-tuning data with the scaling law},
  author = {Huanjun Kong},
  journal= {arXiv preprint arXiv:2405.02817},
  year   = {2024}
}

备注

5 pages, 3 tables, 3 figures