中文

基于稀疏自编码器的约束对齐

人工智能 2025-07-11 v4 计算与语言

摘要

大语言模型(LLM)与人类偏好的对齐仍是一个关键挑战。虽然基于人类反馈的强化学习(RLHF)和直接偏好优化(DPO)等后训练技术取得了显著成功,但它们往往引入计算低效和训练不稳定。本文提出了特征级约束偏好优化(FPO),这是一种旨在简化对齐过程同时保证稳定性的新方法。FPO 利用预训练的稀疏自编码器(SAE)并引入特征级约束,实现了高效、稀疏性强制的对齐。我们的方法通过使用训练良好的稀疏自编码器中激活的稀疏特征获得效率,并通过特征级离线参考保证序列 KL 散度的质量。基准数据集上的实验结果表明,与最先进的基线相比,FPO 在胜率上实现了 5.08% 的绝对提升,且计算成本大幅降低,使其成为高效且可控的 LLM 对齐的有前景的解决方案。

关键词

引用

@article{arxiv.2411.07618,
  title  = {Constrain Alignment with Sparse Autoencoders},
  author = {Qingyu Yin and Chak Tou Leong and Minjun Zhu and Hanqi Yan and Qiang Zhang and Yulan He and Wenjie Li and Jun Wang and Yue Zhang and Linyi Yang},
  journal= {arXiv preprint arXiv:2411.07618},
  year   = {2025}
}