FinRAG-12B:面向银行业务的 grounding 问答生产验证配方
人工智能
2026-05-08 v1 计算与语言
多智能体系统
摘要
大型语言模型 (LLM) 正在快速被广泛采用,但在银行行业的应用面临高准确率要求、监管合规需求以及需提供可验证且 grounded 回应的挑战。我们提出一种统一、数据高效的框架,用于训练针对特定领域的 LLM,使其在实际部署约束下优化答案质量、citation grounding 以及校准拒绝。首先,我们描述了一种数据生成管道,结合 LLM 作为判官的过滤、citation 标注和课程学习,仅需 1.43 亿 token 即可。生成的 12B 参数模型在 answer quality 和 citation grounding 方面均优于 GPT-4.1,虽在 citation 方面存在适度权衡。其次,我们提出校准拒绝机制:仅通过 22% 的不可回答样本训练即可实现 12% 的“我不知道”率,显著优于基础模型的 4.3% 危险率,同时避免 GPT-4.1 的过度拒绝(20.2%),并在实际部署中实现了 7.1 个百分点的查询解决率提升(p < 0.001)。此外,该模型相较 GPT-4.1 在响应速度上快 3-5 倍,成本降低 20-50 倍。
引用
@article{arxiv.2605.05482,
title = {FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking},
author = {Denys Katerenchuk and Pablo Duboue and Keelan Evanini and David Gondek and Nithin Govindugari and Olivier Allauzen and Joshua Baptiste and David J More and Joshua Schechter},
journal= {arXiv preprint arXiv:2605.05482},
year = {2026}
}
备注
7 pages, ACL 2026 conference