中文

前缀在推理模型调优中的作用

计算与语言 2026-01-06 v1

摘要

最近的对齐研究通常从监督微调(SFT)数据集中移除介绍性开场白短语。本工作挑战了这一假设。我们假设安全和推理导向的前缀句子作为轻量级对齐信号,可引导模型解码 toward更安全、更连贯的响应。为检验此假设,我们在三个核心模型能力上对三个R1系列模型进行微调:推理(数学、编码)、安全和事实性,系统性地变更前缀包含率从0%到100%。结果表明,前缀条件化SFT在提升安全性和推理性能方面都有效,在对抗基准(WildJailbreak、StrongReject)上Safe@1准确率提升最高可达6%,GSM8K推理提升7%。然而,事实性和编码任务显示出边际或负面效应,这表明前缀引起的搜索空间缩小对结构化推理有益。token级损失分析进一步揭示,诸如“revised”和“logically”等前缀token的梯度幅度较高,充当对齐锚点,稳定推理轨迹。我们的发现表明,前缀条件化为改善推理安全提供了可扩展且可解释的机制,作为传统奖励方法的隐式对齐形式。

关键词

引用

@article{arxiv.2601.01624,
  title  = {How Does Prefix Matter in Reasoning Model Tuning?},
  author = {Raj Vardhan Tomar and Preslav Nakov and Yuxia Wang},
  journal= {arXiv preprint arXiv:2601.01624},
  year   = {2026}
}