中文

选择性弱到强的泛化

计算与语言 2025-11-19 v1 人工智能

摘要

未来的超人类模型将超越人类的能力,而人类只能对超人类模型进行“弱”监督。为解决缺乏高质量数据以进行模型对齐的问题,一些关于弱到强泛化(W2SG)的工作通过对强预训练模型进行微调以实现弱监督下的泛化。然而,现有方法始终使用弱监督,导致鲁棒性问题,部分弱标签对模型实际上是有害的。本文提出了选择性W2SG框架,以避免不必要地使用弱监督。我们训练二分类器 P(IK) 来识别强模型可以回答的问题,并使用其自生成的标签进行对齐。我们进一步采用图平滑方法细化弱标签。在三个基准数据集上的大量实验表明,我们的方法 consistently 优于竞争性基线。进一步分析显示,P(IK) 可以跨任务和难度级别进行泛化,这表明选择性W2SG有助于超对齐。

关键词

引用

@article{arxiv.2511.14166,
  title  = {Selective Weak-to-Strong Generalization},
  author = {Hao Lang and Fei Huang and Yongbin Li},
  journal= {arXiv preprint arXiv:2511.14166},
  year   = {2025}
}

备注

AAAI2025 Special Track on AI Alignment