辩论有助于弱到强的泛化
计算与语言
2025-01-24 v1 人工智能
摘要
对已具备能力的模型进行对齐常用的方法依赖于人类提供的监督。然而,未来的超人类模型将超越人的能力。因此,人类只能为这些模型提供弱监督。这会削弱未来AI系统的安全性。可扩展的监督和弱到强的泛化是两种解决这一问题的互补方法。本文尝试将这两种方法的优势结合起来进一步改善对齐。具体而言,我们研究了如何利用强大预训练模型改善人类监督,然后用增强的弱人类监督来监督强大模型。为实现迭代性经验性进展,我们考虑一种类比:我们能否使用强大模型来改善弱模型的监督,然后用它来监督强大模型?我们通过在ground truth标签上辅助大强大模型进行微调,然后用弱模型生成的标签来微调强大模型来进行实证测试。我们发现,辩论可以帮助弱模型从不可信赖的强大模型中提取可信信息,这为训练弱模型时提供了上下文。我们还展示,弱模型的集合能利用来自强大模型辩论者生成的长篇论点,从而获得更稳健的监督估计。大量实验表明,这种组合方法在OpenAI的弱到强NLP基准测试中实现了更好的对齐,这表明辩论有望帮助弱到强的泛化。
引用
@article{arxiv.2501.13124,
title = {Debate Helps Weak-to-Strong Generalization},
author = {Hao Lang and Fei Huang and Yongbin Li},
journal= {arXiv preprint arXiv:2501.13124},
year = {2025}
}
备注
AAAI2025 Special Track on AI Alignment (Oral presentation)