中文

用于数学推理的偏差约束前缀表示微调

机器学习 2025-11-17 v1 人工智能

摘要

参数高效微调通过更新最小参数子集来增强模型在下游任务上的性能。表示微调方法通过冻结模型权重并优化内部表示,使用比PEFT更少的参数,进一步提高了效率,在多个任务上优于PEFT。然而,ReFT在数学推理任务上表现出显著的性能下降。为了解决这个问题,本文证明了ReFT在数学任务上表现不佳的主要原因是其在早期推理阶段难以生成有效的推理前缀。此外,ReFT扰乱了数值编码,并且在CoT阶段错误会累积。基于这些观察,本文提出了偏差约束前缀表示微调,通过截断训练数据来优化初始推理前缀的生成,干预早期推理阶段以防止错误累积,并限制干预向量的幅度以避免干扰数值编码,从而增强ReFT的数学推理能力。跨多种模型架构的大量实验表明,BREP在数学推理任务上优于标准ReFT和基于权重的PEFT方法,展现出卓越的有效性、效率和鲁棒的泛化能力。源代码可在 https://github.com/LiangThree/BREP 获取。

关键词

引用

@article{arxiv.2511.10707,
  title  = {Bias-Restrained Prefix Representation Finetuning for Mathematical Reasoning},
  author = {Sirui Liang and Pengfei Cao and Jian Zhao and Cong Huang and Jun Zhao and Kang Liu},
  journal= {arXiv preprint arXiv:2511.10707},
  year   = {2025}
}

备注

accepted by aaai2026