中文

DianJin-R1:增强大语言模型金融推理能力评估与提升

人工智能 2025-04-23 v1

摘要

大语言模型(LLMs)在金融领域的有效推理仍是核心挑战,相关任务往往需要领域专业知识、精确数值计算以及严格遵守合规规则。我们提出 DianJin-R1,一个通过推理增强监督和强化学习解决这些挑战的框架。核心在于构建 DianJin-R1-Data 数据集,源自 CFLUE、FinQA 及自有合规语料库(中文合规检查 CCC),融合多样化金融推理场景与验证标注。我们的模型 DianJin-R1-7B 与 DianJin-R1-32B 基于 Qwen2.5-7B-Instruct 与 Qwen2.5-32B-Instruct 微调,采用结构化格式生成推理步骤与最终答案。为进一步提升推理质量,我们应用组相对政策优化(GRPO)——一种集成双重奖励信号的强化学习方法:一种鼓励结构化输出,另一种奖励答案正确性。我们在五个基准测试中评估模型:三项金融数据集(CFLUE、FinQA、CCC)和两项通用推理基准(MATH-500、GPQA-Diamond)。实验结果表明,DianJin-R1 模型在复杂金融任务上始终优于非推理模型,尤其在真实世界 CCC 数据集上,单调用推理模型可与需要显著更多计算资源的多智能体系统持平甚至超越。这些发现表明,DianJin-R1 通过结构化监督与奖励对齐学习有效提升了金融推理,为实际应用提供了可扩展且实用的解决方案。

关键词

引用

@article{arxiv.2504.15716,
  title  = {DianJin-R1: Evaluating and Enhancing Financial Reasoning in Large Language Models},
  author = {Jie Zhu and Qian Chen and Huaixia Dou and Junhui Li and Lifan Guo and Feng Chen and Chi Zhang},
  journal= {arXiv preprint arXiv:2504.15716},
  year   = {2025}
}