DoG-Instruct:通过基于文本的指令封装迈向优质指令微调数据
计算与语言
2024-05-28 v2
摘要
LLM 指令遵循能力的提升高度依赖于高质量指令-回答对的可用性。遗憾的是,当前用于收集此类配对的方法要么面临难以承受的人力成本,要么在 LLM 自生成过程中存在严重幻觉。为应对这些挑战,本文提出一种可扩展方案。其涉及训练 LLM 基于人工撰写文档生成指令-回答对,而非仅依赖无上下文的自生成。我们提出的方法不仅利用了人工撰写文档在减少幻觉方面的优势,还使用 LLM 对文档表达进行封装,从而弥合各类文档风格与标准 AI 回答之间的鸿沟。实验表明,我们的方法在多个基准上优于现有典型方法。特别地,相较于表现最佳的基线,使用我们生成数据集训练的 LLM 在 AlpacaEval 上展现出 10% 的相对性能提升,尽管仅使用了其 1/5 的训练数据。此外,一项全面的人工评估验证了我们所生成数据的质量。我们训练的封装器公开于 https://github.com/Bahuia/Dog-Instruct。
关键词
引用
@article{arxiv.2309.05447,
title = {DoG-Instruct: Towards Premium Instruction-Tuning Data via Text-Grounded Instruction Wrapping},
author = {Yongrui Chen and Haiyun Jiang and Xinting Huang and Shuming Shi and Guilin Qi},
journal= {arXiv preprint arXiv:2309.05447},
year = {2024}
}
备注
Accepted in NAACL 2024