中文

稀疏自编码器轻量化偏好建模:SparseRM

人工智能 2025-11-12 v1 计算与语言

摘要

奖励模型(RM)是大型语言模型(LLM)后训练中的核心组件,作为人类偏好评估的代理并指导模型对齐。然而,在有限资源下训练可靠的 RM 仍具挑战性,因为这需要大规模偏好标注以及高昂的 LLM 微调成本。为此,我们提出了 SparseRM,利用稀疏自编码器(SAE)提取模型表示中编码的偏好相关信息,从而实现轻量且可解释的奖励模型。SparseRM 首先使用 SAE 将 LLM 表示分解为可解释的方向,这些方向捕获偏好相关特征。随后将表示投影到这些方向上以计算对齐分数,这量化了每个偏好特征在表示中的强度。一个简单的奖励头汇总这些分数以预测偏好分数。在三个偏好建模任务上的实验表明,SparseRM 在大多数主流 RM 上实现了优异性能,同时使用的可训练参数不足 1\%。此外,它无缝集成到下游对齐管道中,凸显其高效对齐的潜力。

关键词

引用

@article{arxiv.2511.07896,
  title  = {SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder},
  author = {Dengcan Liu and Jiahao Li and Zheren Fu and Yi Tu and Jiajun Li and Zhendong Mao and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2511.07896},
  year   = {2025}
}

备注

15pages,11figures,AAAI-26