语言模型的串联训练
人工智能
2026-01-27 v2
摘要
随着语言模型的快速改进,我们可以期待它们的行为和推理变得更加困难或不可能由较弱的代理人和人类跟随,从而破坏可解释性和监督。以长期未来为目标,我们发展方法鼓励模型产生 remain intelligible to weaker collaborators 的解决方案。我们将可解释性formalized为handoff robust性:强模型的解决方案若在解答路径上随机交接控制给较弱模型而不导致失败,则被认为是较弱模型可理解的。基于此准则,我们引入tandem training for language models,即一种强化学习范例,其中在训练的 rollout token 被随机抽样自冻结的弱模型而非由正在训练的强模型。由于只有当强模型的行动和推理过程能够被弱模型延续时才会成功——即两种模型能够共同构建成功的解决方案——使用tandem training优化标准 RL目标会隐式地激励正确性和可解释性。在GSM8K数学推理任务中,tandem training可靠地教会模型放弃术语并适应较弱合作伙伴的语言,同时保持任务准确性。我们的结果表明,这是一种构建保持较弱代理人可审计的AI系统的有前景的途径,具有对人机合作和多代理通信的意义。
引用
@article{arxiv.2510.13551,
title = {Tandem Training for Language Models},
author = {Robert West and Ashton Anderson and Ece Kamar and Eric Horvitz},
journal= {arXiv preprint arXiv:2510.13551},
year = {2026}
}