中文

自我对弈配合执行反馈:提高大型语言模型的指令跟随能力

计算与语言 2024-07-19 v3 人工智能 机器学习

摘要

大型语言模型(LLMs)的一个核心能力是遵循自然语言指令。然而,如何在没有手动标注的情况下自动构建高质量的训练数据以增强LLMs的复杂指令跟随能力尚未得到解决。本文引入了AutoIF,一种可扩展且可靠的自动生成指令跟随训练数据的方法。AutoIF将指令跟随数据质量的验证转化为代码验证,要求LLMs生成指令、生成相应的检查指令响应正确性的代码以及用于验证代码正确性的单元测试样本。然后,通过基于执行反馈的拒绝抽样,可生成用于监督微调(SFT)和从人类反馈强化学习(RLHF)训练的数据。当应用于Qwen2和LLaMA3等顶级开源LLMs,在自我对齐和强到弱蒸馏设置下,AutoIF在SFT、Offline DPO和Online DPO三种训练算法中均实现了显著的改进。我们的代码已公开发布于https://github.com/QwenLM/AutoIF。

关键词

引用

@article{arxiv.2406.13542,
  title  = {Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models},
  author = {Guanting Dong and Keming Lu and Chengpeng Li and Tingyu Xia and Bowen Yu and Chang Zhou and Jingren Zhou},
  journal= {arXiv preprint arXiv:2406.13542},
  year   = {2024}
}

备注

Work in progress