中文

编程通过反向传播:在微调大语言模型时,一条指令的值量百个示例

人工智能 2026-02-25 v2 计算与语言 机器学习

摘要

大型语言模型(LLMs)通常通过演示或经验来获取行为,但它们的训练数据大多为声明性的:指令、规则和描述,指定行为而不显示如何执行它们。我们引入编程通过反向传播(PBB):一种训练方法,使 LLMs 能够从训练期间遇到的声明性指令中获取程序化知识(即可重用的行为)。通过 PBB,训练数据中的指令为在模型权重中“编程”特定行为提供了机会。PBB 的核心原则是将指令如何映射到行为的学习与内化新指令分开。我们设计了两种不同的 PBB 课程,利用这一原则。通过控制实验,我们在两个领域(从 Python 源代码执行算法和从上下文无关语法生成文本)中展示了这些课程相对于在均匀数据混合物上训练的优势。关键的是,PBB 具有高度的样本效率,一条指令可替代最多 100 个执行示例。尽管在训练数据中执行指令的可靠性不如在上下文中给出指令,但我们的结果表明,通过 PBB 可以将程序化知识“编程”到 LLMs 中,这对数据精选和安全性具有重要影响。

关键词

引用

@article{arxiv.2506.18777,
  title  = {Programming by Backprop: An Instruction is Worth 100 Examples When Finetuning LLMs},
  author = {Jonathan Cook and Silvia Sapora and Arash Ahmadian and Akbir Khan and Tim Rocktaschel and Jakob Foerster and Laura Ruis},
  journal= {arXiv preprint arXiv:2506.18777},
  year   = {2026}
}