中文

从偏差-方差视角评估弱到强对齐中的风险

人工智能 2026-04-29 v1

摘要

弱到强对齐提供了可扩展监督的有前景的途径,但当强模型在弱教师盲区处于自信错误时可能失败。理解此类失败需要超越整体准确率,因为弱到强错误不仅取决于强模型是否与其教师不同意,还取决于置信度和不确定性在示例中的分布。在本文中,我们通过偏差-方差-协方差的视角分析弱到强对齐,将 misfit 理论与实际后训练管道联系起来。我们推导了基于 misfit 的弱到强 population risk 上界,研究其经验成分并使用连续置信得分。我们在 PKU-SafeRLHF 和 HH-RLHF 数据集上评估了四种弱到强管道,涵盖监督微调 (SFT)、基于人类反馈的强化学习 (RLHF) 和基于 AI 反馈的强化学习 (RLAIF)。使用一种盲区欺骗指标,该指标隔离了强模型自信错误而弱模型不确定的案例,我们发现强模型的方差是我们所述情境下欺骗的最强经验预测器。协方差提供了额外但较弱的信息,表明弱强依赖性 matters,但本身并不解释所观察到的失败。这些结果表明,强模型的方差可作为弱到强欺骗的早期警报信号,而盲区评估有助于区分失败是源于弱监督还是在弱模型不确定性区域中产生。

关键词

引用

@article{arxiv.2604.25077,
  title  = {Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective},
  author = {Hamid Osooli and Kareema Batool and Rick Gentry and Tiasa Singha Roy and Ashwin Gupta and Anirudha Ramesh},
  journal= {arXiv preprint arXiv:2604.25077},
  year   = {2026}
}