发现隐式大型语言模型对齐目标
机器学习
2026-05-22 v2 计算与语言
摘要
大型语言模型(LLM)对齐依赖复杂的奖励信号,这些信号常常掩盖具体激励的行为,可能引发严重的误对齐和奖励攻击风险。现有解释方法通常依赖预定义的评估标准,可能遗漏“未知的未知”,或未能识别覆盖模型行为且具有因果性的目标。为此,我们提出 Obj-Disco 框架,自动将对齐奖励信号分解为稀疏加权的人类可解释自然语言目标的组合。该方法利用迭代贪心算法分析训练检查点之间的行为变化,识别并验证最能解释剩余奖励信号的候选目标。广泛的评估覆盖多种任务、模型规模和对齐算法,表明该框架具有良好的鲁棒性。在流行的开源奖励模型实验中,框架始终能捕获 >90% 的奖励行为,人类评估进一步印证了这一发现。此外,对一项开源奖励模型的案例研究表明,Obj-Disco 能够成功识别伴随预期行为同时出现的潜在误导性激励。我们的工作为揭示 LLM 对齐中的隐式目标提供了关键工具,为更透明和更安全的人工智能开发铺平了道路。
引用
@article{arxiv.2602.15338,
title = {Discovering Implicit Large Language Model Alignment Objectives},
author = {Edward Chen and Sanmi Koyejo and Carlos Guestrin},
journal= {arXiv preprint arXiv:2602.15338},
year = {2026}
}
备注
ICML 2026