中文

弱到强泛化:通过弱监督激发强能力

计算与语言 2023-12-18 v1

摘要

广泛使用的对齐技术,如基于人类反馈的强化学习(RLHF),依赖于人类监督模型行为的能力——例如,评估模型是否忠实地遵循指令或生成安全的输出。然而,未来的超人类模型将以复杂的方式行事,人类难以可靠地评估;人类只能对超人类模型进行弱监督。我们研究了这个问题的类比:弱模型监督能否激发更强大模型的全部能力?我们使用GPT-4系列中的一系列预训练语言模型,在自然语言处理(NLP)、国际象棋和奖励建模任务上进行了测试。我们发现,当我们简单地在弱模型生成的标签上微调强预训练模型时,它们始终比其弱监督者表现更好,我们将这种现象称为弱到强泛化。然而,仅通过简单微调,我们距离恢复强模型的全部能力还有很大差距,这表明像RLHF这样的技术可能难以扩展到超人类模型,除非进一步研究。我们发现简单方法通常可以显著改善弱到强泛化:例如,当使用GPT-2级别的监督者和辅助置信度损失微调GPT-4时,我们可以在NLP任务上恢复接近GPT-3.5级别的性能。我们的结果表明,今天在对齐超人类模型这一基本挑战上取得实证进展是可行的。

关键词

引用

@article{arxiv.2312.09390,
  title  = {Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision},
  author = {Collin Burns and Pavel Izmailov and Jan Hendrik Kirchner and Bowen Baker and Leo Gao and Leopold Aschenbrenner and Yining Chen and Adrien Ecoffet and Manas Joglekar and Jan Leike and Ilya Sutskever and Jeff Wu},
  journal= {arXiv preprint arXiv:2312.09390},
  year   = {2023}
}