中文

利用稀疏自编码器的模型内部状态引导LLM后训练数据工程

机器学习 2026-05-27 v1 人工智能 计算与语言

摘要

模型内部状态编码了关于大型语言模型(LLM)如何处理其训练数据的丰富信息;然而,后训练数据工程主要依赖于外部信号,而忽略了模型内部状态中丰富的内在信号。我们提出了SAERL,一个用于LLM强化学习(RL)的数据工程框架。它使用稀疏自编码器(SAE)(一种先进的机制可解释性工具)提取的模型内部状态,对三个内在数据属性进行建模:多样性、难度和质量。每个属性都支撑一个具体的数据工程操作:用于批次多样性控制的具有适度批次混合的SAE空间聚类、用于从易到难课程排序的难度代理,以及用于数据过滤的质量探针。SAERL在Qwen2.5-Math-1.5B上,相比vanilla GRPO平均准确率提高了3.00%,并以减少20%的训练步数达到目标准确率,在模型规模和RL算法上均有一致的提升。实验表明,SAE可以有效地跨模型系列和规模迁移,作为一种轻量级且可重用的数据工程工具。这些结果表明,模型内部状态是后训练数据工程中强大且实用的信号来源。

关键词

引用

@article{arxiv.2605.27354,
  title  = {Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders},
  author = {Yi Jing and Zao Dai and Jinwu Hu and Zijun Yao and Lei Hou and Juanzi Li and Xiaozhi Wang},
  journal= {arXiv preprint arXiv:2605.27354},
  year   = {2026}
}