AI 对齐审计员:用于验证和细化 LLM 目标的贝叶斯框架
机器学习
2025-10-09 v2 计算与语言
摘要
大型语言模型 (LLM) 隐式优化的目标仍然悬而未决,这使得可信的对齐和审计成为巨大的挑战。虽然逆强化学习 (IRL) 可以从行为中推断奖励函数,但现有方法要么产生单一的、过于自信的奖励估计,要么未能解决该任务的根本歧义性 (非可识别性)。本文引入了一个原则性的审计框架,将奖励推断从简单的估计任务重新框架为验证的综合过程。我们的框架利用贝叶斯 IRL,不仅恢复目标分布,还能实现三个关键审计能力:(i) 通过演示后验在连续证据轮次中的收缩来量化并系统性地减少非可识别性;(ii) 提供可操作的、不确定性感知的诊断工具,揭示人为捷径并识别推断目标无法被信任的超分布提示;(iii) 通过显示细化的、低不确定性奖励可直接用于 RLHF,以实现与真实对齐过程相当的训练动力学和毒性降低。经验上,我们的框架成功地审计了一个去毒化的 LLM,产生一个良好校准且可解释的目标,强化对齐保证。总体而言,本工作为审计员、安全团队和监管机构提供了实用的工具箱,用于验证 LLM 正在真正试图实现什么,从而朝着更可信赖和负责任的 AI 迈进。
引用
@article{arxiv.2510.06096,
title = {The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives},
author = {Matthieu Bou and Nyal Patel and Arjun Jagota and Satyapriya Krishna and Sonali Parbhoo},
journal= {arXiv preprint arXiv:2510.06096},
year = {2025}
}
备注
Preprint