弱到强的泛化机制:从潜在知识中引导特征
机器学习
2026-05-14 v1 机器学习
摘要
弱到强(W2S)泛化,即强模型在弱模型输出的监督下进行精调,这已被提出作为对齐超人类 AI 系统的方法。现有理论分析要么固定学生的表示,要么在受限情境中操作。多步 SGD 能否在保留多样化预训练能力的同时实现特征学习 remains open。我们以两层神经网络的奖励模型学习为场景研究 W2S。强模型的预训练表示组织成低维子空间 ,在弱模型在任务 上专业化的监督下进行精调。我们证明强模型有效学习任务 ,在保留通用能力的同时引导其预训练知识。这一结果在特征学习范式下建立了 W2S 泛化,意味着强模型通过 W2S 训练获得目标特征方向,而非先验给定。此外,W2S 保存预训练的 off-target 特征,而标准监督性精调在 off-target 特征方向与目标特征相关时会导致灾难性遗忘。数值实验在合成数据上确认了我们的理论结果。
引用
@article{arxiv.2605.12908,
title = {The Mechanism of Weak-to-Strong Generalization: Feature Elicitation from Latent Knowledge},
author = {Ryoya Awano and Taiji Suzuki},
journal= {arXiv preprint arXiv:2605.12908},
year = {2026}
}
备注
48 pages, 1 figure