中文

OpenRFT:基于强化微调的领域特定推理基础模型适应方法

人工智能 2024-12-24 v1

摘要

OpenAI最近推出的强化微调(RFT)展示了推理基础模型的潜力,为超越简单模式模仿的微调提供了新范式。本技术报告介绍了\emph{OpenRFT}——我们在RFT同一设置下,对通用推理模型进行领域特定任务微调的尝试。OpenRFT通过三种方式利用领域特定样本来解决缺乏推理步骤数据和训练样本数量有限的挑战:问题增强、合成推理过程数据和few-shot ICL。评估在SciKnowEval上进行,OpenRFT仅需每个任务约100个领域特定样本即可实现显著性能提升。后续版本将持续更新更多实验结果。源代码、数据集和模型已公开于:https://github.com/ADaM-BJTU/OpenRFT

关键词

引用

@article{arxiv.2412.16849,
  title  = {OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning},
  author = {Yuxiang Zhang and Yuqi Yang and Jiangming Shu and Yuhang Wang and Jinlin Xiao and Jitao Sang},
  journal= {arXiv preprint arXiv:2412.16849},
  year   = {2024}
}