基于熵-KL 散度的标记掩码:大型语言模型选择性微调的新方法
人工智能
2026-05-29 v1
摘要
监督微调(SFT)随后强化学习(RL)已成为大型语言模型后训练标准范式。该范式为RL探索提供冷启动,避免纯RL中基于策略采样导致正样本不足的低效问题。然而,实际中,现有方法常在SFT初始化阶段使用少量数据,而RL阶段数据量较大,这会导致模型拟合有限样本并偏离预训练分布。这种分布迁移阻碍了模型在后续RL训练中有效探索的能力。为此,我们提出在低数据 regime 下,SFT应优先激活任务相关能力而非记忆特定内容。基于此,我们提出EKSFT(Entropy-KL 选择性微调),通过对表现出高熵或高KL散度的标记进行选择性掩码。通过排除这些高不确定性、分布迁移标记的模仿,EKSFT在注入任务特定知识的同时保持模型预训练分布的完整性。在数学推理基准测试中的经验评估表明,EKSFT持续优于标准SFT。进一步从EKSFT模型进行RL微调,后RL性能持续更佳,表明RL阶段的探索能力得到改善。我们的代码与数据集已在 https://github.com/MINE-USTC/EKSFT 提供。
引用
@article{arxiv.2605.29303,
title = {Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models},
author = {Qi Liu and Mingdi Sun and Yongyi He and Zhi Zheng and Tong Xu and Yi Zheng and Zhefeng Wang and Enhong Chen},
journal= {arXiv preprint arXiv:2605.29303},
year = {2026}
}
备注
17 pages