中文

对比式弱到强推广

计算与语言 2025-10-10 v1 人工智能

摘要

弱到强推广提供了一种通过训练更强的模型于来自对齐较弱模型的样本上,而无需人类反馈或显式奖励建模,从而缩放大语言模型(LLM)的范式。然而,其鲁棒性和推广性受到弱模型输出中噪声和偏置的限制,致使其在实际应用中受到约束。为此,我们利用隐式奖励,这些奖励通过 log 概率比率近似显式奖励,并揭示其与 Contrastive Decoding (CD) 的结构等价性——CD 已显示可减少 LLM 生成中的噪声。基于这一联系,我们提出对比式弱到强推广 (ConG) 框架,使用 pre- 和 post-alignment 弱模型之间的对比解码来生成更高质量的样本。该方法实现了更可靠的能力迁移、去噪以及改进的鲁棒性,显著缓解了传统弱到强方法的局限性。跨不同模型族的实证结果确认了一致的改进,证明了 ConG 的普适性和有效性。综上所述,我们的发现凸显了 ConG 在推广弱到强能力方面的潜力,并为 AGI 提供了一条有前景的道路。

关键词

引用

@article{arxiv.2510.07884,
  title  = {Contrastive Weak-to-strong Generalization},
  author = {Houcheng Jiang and Junfeng Fang and Jiaxin Wu and Tianyu Zhang and Chen Gao and Yong Li and Xiang Wang and Xiangnan He and Yang Deng},
  journal= {arXiv preprint arXiv:2510.07884},
  year   = {2025}
}