稀疏自编码器在 LLM 特征空间中合成数据:少即是多
计算与语言
2026-05-29 v3 人工智能
摘要
大语言模型(LLM)后训练数据的多样性对于有效的下游性能至关重要。许多现有的后训练数据构建方法使用基于文本的指标来量化语言变异,但此类指标仅提供关于决定下游性能的任务相关特征的弱信号。本文引入了特征激活覆盖率(Feature Activation Coverage, FAC),该指标在可解释的特征空间中衡量数据多样性。基于该指标,我们进一步提出了一个以多样性为导向的数据合成框架,称为 FAC Synthesis,后者首先使用稀疏自编码器从种子数据集中识别缺失的特征,然后生成显式反映这些特征的合成样本。实验表明,我们的方法在包括指令遵循、毒性检测、奖励建模和行为操控等多个任务上,均能显著提升数据多样性和下游性能。有趣的是,我们发现跨模型族(即 LLaMA、Mistral 和 Qwen)之间存在共享的、可解释的特征空间,使其能够实现跨模型的知识迁移。我们的工作为探索大语言模型的数据中心优化提供了坚实且实用的 methodology。
引用
@article{arxiv.2602.10388,
title = {Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders},
author = {Zhongzhi Li and Xuansheng Wu and Yijiang Li and Lijie Hu and Ninghao Liu},
journal= {arXiv preprint arXiv:2602.10388},
year = {2026}
}