中文

Fin-R1:通过强化学习实现金融推理的大语言模型

计算与语言 2026-03-20 v5

摘要

近年来,GPT、Gemini、Claude 和 DeepSeek 等通用大语言模型(LLM)以前所未有的速度发展。尽管取得了这些成就,但由于数据源碎片化、推理过程不透明以及对业务应用的迁移能力弱,它们在金融领域的应用仍具挑战性。作为回应,我们推出了 Fin-R1,一个专为金融场景设计的推理 LLM。Fin-R1 具有 70 亿参数的紧凑规模,在解决上述挑战的同时降低了部署成本。其开发遵循两阶段流程。首先,我们构建了 Fin-R1-Data,这是一个高质量金融数据集,包含 60,091 个思维链样本,从多个权威基准中蒸馏并筛选而来,以确保一致性和可靠性。其次,我们使用 Fin-R1-Data 通过监督微调(SFT)训练 Fin-R1,随后进行强化学习(RL)。这一阶段大幅提升了模型解决复杂金融推理任务的能力,产生既准确又可解释的输出。尽管参数规模相对较小,Fin-R1 在既定的金融基准上取得了具有竞争力的实证表现,并在合规检查和智能投顾中展示了实用价值。我们的代码公开于 https://github.com/SUFE-AIFLM-Lab/Fin-R1,已获得超过 700 个 star。

关键词

引用

@article{arxiv.2503.16252,
  title  = {Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning},
  author = {Zhaowei Liu and Xin Guo and Zhi Yang and Fangqi Lou and Lingfeng Zeng and Jinyi Niu and Mengping Li and Qi Qi and Zhiqiang Liu and Yiyang Han and Dongpo Cheng and Ronghao Chen and Huacan Wang and Xingdong Feng and Huixia Judy Wang and Chengchun Shi and Liwen Zhang},
  journal= {arXiv preprint arXiv:2503.16252},
  year   = {2026}
}