审计语言模型的隐藏目标
人工智能
2025-03-31 v2 计算与语言
机器学习
摘要
我们研究进行对齐审计的可行性:即调查模型是否具有非预期目标。作为测试平台,我们训练了一个具有隐藏目标的语言模型。我们的训练流程首先教会模型关于 RLHF 奖励模型(RMs)中可利用的错误,随后训练模型去利用其中部分错误。我们通过分布外评估验证了该模型能够泛化,表现出它认为 RMs 会给予高评分的任何行为,包括在训练期间未被强化的行为。我们利用该模型从两方面研究对齐审计。首先,我们开展了一场盲审游戏,四个不知道模型隐藏目标或训练过程的团队对其令人担忧的行为及成因进行调查。三个团队成功揭示了模型的隐藏目标,所使用的技术包括基于稀疏自编码器(SAEs)的可解释性、行为攻击和训练数据分析。其次,我们对八种审计模型的技术进行了非盲跟进研究,分析了它们的优势与局限。总体而言,我们的工作提供了一个利用对齐审计发现模型隐藏目标的具体案例,并提出了一套用于实践和验证对齐审计进展的方法论。
引用
@article{arxiv.2503.10965,
title = {Auditing language models for hidden objectives},
author = {Samuel Marks and Johannes Treutlein and Trenton Bricken and Jack Lindsey and Jonathan Marcus and Siddharth Mishra-Sharma and Daniel Ziegler and Emmanuel Ameisen and Joshua Batson and Tim Belonax and Samuel R. Bowman and Shan Carter and Brian Chen and Hoagy Cunningham and Carson Denison and Florian Dietz and Satvik Golechha and Akbir Khan and Jan Kirchner and Jan Leike and Austin Meek and Kei Nishimura-Gasparian and Euan Ong and Christopher Olah and Adam Pearce and Fabien Roger and Jeanne Salle and Andy Shih and Meg Tong and Drake Thomas and Kelley Rivoire and Adam Jermyn and Monte MacDiarmid and Tom Henighan and Evan Hubinger},
journal= {arXiv preprint arXiv:2503.10965},
year = {2025}
}