SAFER:稀疏自编码器探测奖励模型中的安全性
计算与语言
2026-02-02 v3 人工智能
摘要
强化学习从人类反馈(RLHF)是对齐大型语言模型(LLM)与人类价值观的关键范式,但其核心奖励模型仍然基本不透明。本文提出稀疏自编码器增强奖励模型(Sparse Autoencoder For Enhanced Reward,\textbf{SAFER}),这是一种通过机制分析来解释和改进奖励模型的新型框架。利用稀疏自编码器(SAE),我们在奖励模型激活中发现可被人类理解的特征,从而洞察安全相关决策。我们将SAFER应用于面向安全的偏好数据集,并量化 individual features 的显著性——即在被选取响应与被拒绝响应之间的激活差异。借助这些特征级信号,我们设计了针对性的数据投毒和去噪策略。实验表明,SAFER能够在不牺牲一般聊天性能的前提下,以最小的数据修改精准地降低或提升安全对齐。我们的 метод为高风险LLM对齐任务中的奖励模型解释、审计与精炼提供了贡献。我们的代码已公开于 https://github.com/xzy-101/SAFER-code。\textit{本文讨论与奖励模型安全相关的话题,可能包含强调潜在风险或不安全结果的讨论或示例。}
引用
@article{arxiv.2507.00665,
title = {SAFER: Probing Safety in Reward Models with Sparse Autoencoder},
author = {Wei Shi and Ziyuan Xie and Sihang Li and Xiang Wang},
journal= {arXiv preprint arXiv:2507.00665},
year = {2026}
}