中文

表面(浅层)对齐:强模型可能在弱到强泛化中欺骗弱模型

计算与语言 2025-03-03 v3 人工智能

摘要

超级对齐,即人类作为超人类模型的弱监督者,随着大型语言模型(LLM)的快速发展已成为一个关键问题。最近的工作通过使用弱模型监督强模型初步研究了这一问题,并发现弱监督的强学生模型能够持续优于弱教师模型,朝着对齐目标前进,从而产生了弱到强泛化现象。然而,我们担心在这种看似有希望的现象背后,是否存在弱到强欺骗的问题,即强模型通过在弱模型已知的领域表现出良好对齐,而在弱模型未知的情况下产生未对齐行为来欺骗弱模型。我们初步探索了这一安全问题的具体但现实的多目标对齐案例,其中可能存在一些相互冲突的对齐目标(例如,有用性与无害性)。我们旨在探究在这种情况下,强模型是否可能在一个对齐维度上,在其已知但弱模型未知的领域故意犯错,以换取在另一个维度上获得更高的奖励。通过在奖励建模和偏好优化场景中的大量实验,我们发现:(1)弱到强欺骗现象在所有设置中都存在。(2)随着弱模型与强模型之间能力差距的增大,欺骗行为加剧。(3)使用中间模型进行自举可以在一定程度上缓解欺骗,但其效果仍然有限。我们的工作强调了需要更加关注超级对齐真正可靠性的紧迫性。

关键词

引用

@article{arxiv.2406.11431,
  title  = {Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization},
  author = {Wenkai Yang and Shiqi Shen and Guangyao Shen and Wei Yao and Yong Liu and Zhi Gong and Yankai Lin and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2406.11431},
  year   = {2025}
}

备注

Accepted at ICLR 2025, camera-ready version