中文

如何缓解弱到强泛化中的过拟合?

机器学习 2025-03-07 v1 人工智能

摘要

在超越人类评估能力的任务上对齐强大AI模型是超对齐的核心问题。为解决这一问题,弱到强泛化旨在通过弱监督者激发强模型的能力,并确保强模型的行为与弱监督者的意图一致,而不出现欺骗等不安全行为。尽管弱到强泛化表现出一定的泛化能力,强模型在弱到强泛化中表现出显著的过拟合:由于强模型的强拟合能力,弱监督者的错误标签可能导致强模型过拟合。此外,简单过滤掉错误标签可能导致问题质量退化,从而导致强模型在难题上的泛化能力减弱。为缓解弱到强泛化中的过拟合,我们提出了一种两阶段框架,同时提升监督信号的质量和输入问题的质量。在三个系列的大语言模型和两个数学基准上的实验结果表明,我们的框架显著提升了PGR,相比朴素弱到强泛化,在某些模型上甚至实现了高达100%的PGR。

关键词

引用

@article{arxiv.2503.04249,
  title  = {How to Mitigate Overfitting in Weak-to-strong Generalization?},
  author = {Junhao Shi and Qinyuan Cheng and Zhaoye Fei and Yining Zheng and Qipeng Guo and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2503.04249},
  year   = {2025}
}