语言模型精调中的推理标记与模板标记解耦
计算与语言
2024-12-20 v1
摘要
在使用代理-任务数据集增强大语言模型 (LLM) 能力时,当前方法常将样本中的所有标记视为等重要。然而我们认为,具体的推理标记与模板标记(例如控制输出格式的标记)在重要性和学习复杂度方面存在显著差异,亟需对其进行解耦并采取不同的处理方式。为此,我们提出了一种新的洗牌感知判别器 (SHAD),用于自适应标记判别。SHAD 通过利用洗牌后输入-输出组合在样本间所观察到的可预测性差异来对标记进行分类:由于其重复性,模板标记在样本间保持可预测性,而推理标记则不具有这种可预测性。使用 SHAD,我们提出了推理突出显示微调 (RFT) 方法,在微调期间自适应地强调推理标记,显著优于常规监督式微调 (SFT)。
引用
@article{arxiv.2412.14780,
title = {Disentangling Reasoning Tokens and Boilerplate Tokens For Language Model Fine-tuning},
author = {Ziang Ye and Zhenru Zhang and Yang Zhang and Jianxin Ma and Junyang Lin and Fuli Feng},
journal= {arXiv preprint arXiv:2412.14780},
year = {2024}
}