SeDi-Instruct:通过自导向指令生成增强语言模型的对齐
计算与语言
2025-02-10 v1
摘要
大语言模型(LLM)的快速演进使业界得以开发各种基于人工智能的服务。指令微调被认为是使基础模型适应目标领域以向客户提供高质量服务的关键。指令微调的一个核心挑战是获取高质量的指令数据。Self-Instruct利用ChatGPT API自动生成指令数据,缓解了数据稀缺问题。为了提高指令数据的质量,Self-Instruct丢弃了许多由ChatGPT生成的指令,尽管由于大量无用的API调用,这在成本上效率低下。为了以低成本生成高质量的指令数据,我们提出了一种新颖的数据生成框架——自导向指令生成(SeDi-Instruct),该框架采用基于多样性的过滤和迭代反馈任务生成。基于多样性的过滤通过增强批次中指令的多样性,在不丢弃过多低质量生成指令的情况下保持模型准确性,从而降低了合成指令数据的成本。迭代反馈任务生成将指令生成与训练任务相结合,并利用训练过程中获得的信息来创建高质量的指令集。结果表明,与传统方法相比,SeDi-Instruct将AI模型的准确性提高了5.2%,同时将数据生成成本降低了36%。
引用
@article{arxiv.2502.04774,
title = {SeDi-Instruct: Enhancing Alignment of Language Models through Self-Directed Instruction Generation},
author = {Jungwoo Kim and Minsang Kim and Sungjin Lee},
journal= {arXiv preprint arXiv:2502.04774},
year = {2025}
}
备注
12 pages, 12 figures