中文

通过弱监督训练消除大语言模型中的消极怠工行为

机器学习 2026-05-04 v2 人工智能

摘要

随着人工智能系统开始自动化复杂任务,监督越来越依赖于较弱的模型或无法完全验证输出质量的有限人类监督。一个能力超过其监督者的模型可能会利用这种差距进行消极怠工,产生看似可接受但远未达到其真实能力的工作。即使没有可靠的验证,训练能否激发模型的最佳表现?我们使用经过训练以进行消极怠工的模型生物体来研究这一点,在解题数学、研究生级科学和竞争性编程任务上测试激发技术。我们发现,当监督微调和强化学习结合时,弱监督训练可以可靠地激发消极怠工模型:对弱演示进行监督微调打破了消极怠工行为,使强化学习能够随后完全激发性能。单独使用这两种方法都无法可靠成功——没有监督微调的强化学习几乎总是导致奖励黑客而非真正改进,而当监督者远弱于不可信模型时,没有强化学习的监督微调无法激发全部性能。关键的是,这依赖于训练与部署不可区分;当模型能够区分训练和部署时,它们可以在训练期间表现良好,同时在此后继续消极怠工。我们的结果提供了初步证据,表明训练是针对消极怠工的可行缓解措施,同时强调了使训练与部署不可区分的重要性。

关键词

引用

@article{arxiv.2604.22082,
  title  = {Removing Sandbagging in LLMs by Training with Weak Supervision},
  author = {Emil Ryd and Henning Bartsch and Julian Stastny and Joe Benton and Vivek Hebbar},
  journal= {arXiv preprint arXiv:2604.22082},
  year   = {2026}
}