选择性弱到强的泛化
计算与语言
2025-11-19 v1 人工智能
摘要
未来的超人类模型将超越人类的能力,而人类只能对超人类模型进行“弱”监督。为解决缺乏高质量数据以进行模型对齐的问题,一些关于弱到强泛化(W2SG)的工作通过对强预训练模型进行微调以实现弱监督下的泛化。然而,现有方法始终使用弱监督,导致鲁棒性问题,部分弱标签对模型实际上是有害的。本文提出了选择性W2SG框架,以避免不必要地使用弱监督。我们训练二分类器 P(IK) 来识别强模型可以回答的问题,并使用其自生成的标签进行对齐。我们进一步采用图平滑方法细化弱标签。在三个基准数据集上的大量实验表明,我们的方法 consistently 优于竞争性基线。进一步分析显示,P(IK) 可以跨任务和难度级别进行泛化,这表明选择性W2SG有助于超对齐。
引用
@article{arxiv.2511.14166,
title = {Selective Weak-to-Strong Generalization},
author = {Hao Lang and Fei Huang and Yongbin Li},
journal= {arXiv preprint arXiv:2511.14166},
year = {2025}
}
备注
AAAI2025 Special Track on AI Alignment