中文

Kun:基于指令回译与答案润色的中文自对齐方法

计算与语言 2024-11-06 v4 人工智能

摘要

在本文中,我们介绍了 Kun,这是一种无需依赖人工标注即可为大型语言模型 (LLMs) 创建高质量指令微调数据集的新方法。通过采用基于指令回译和答案润色的自训练算法,Kun 利用来自 Wudao、Wanjuan 和 SkyPile 等不同来源的无标签数据,生成了包含超过一百万条中文指令数据点的大规模数据集。该方法通过使用自我筛选过程来提炼和选择最有效的指令-输出对,显著偏离了传统方法。我们在各种基准上使用 6B 参数的 Yi 模型进行的实验证明了 Kun 的鲁棒性和可扩展性。我们方法的核心贡献在于其算法上的进步(增强了数据保留率和清晰度),以及其创新的数据生成方法(大幅减少了对昂贵且耗时的手动标注的依赖)。该方法为提高 LLMs 的指令遵循能力提供了一个可扩展且高效的解决方案,对其在各个领域的应用具有重要意义。代码和数据集可在 https://github.com/Zheng0428/COIG-Kun 获取

关键词

引用

@article{arxiv.2401.06477,
  title  = {Kun: Answer Polishment for Chinese Self-Alignment with Instruction Back-Translation},
  author = {Tianyu Zheng and Shuyue Guo and Xingwei Qu and Jiawei Guo and Xinrun Du and Qi Jia and Chenghua Lin and Wenhao Huang and Jie Fu and Ge Zhang},
  journal= {arXiv preprint arXiv:2401.06477},
  year   = {2024}
}

备注

12 pages, 12 figures