融合领域知识的金融问答:一种基于 LLM 的多检索器 RAG 方法
计算与语言
2026-01-01 v1 计算工程、金融与科学
机器学习
摘要
本研究项目旨在解决由于缺乏金融领域知识而导致的金融数值推理问答(QA)任务中的错误。尽管大型语言模型(LLMs)取得了最新进展,但金融数值问题仍然具有挑战性,因为它们需要特定的金融领域知识和复杂的多步数值推理。我们实现了一个多检索器检索增强生成器(RAG)系统,以检索外部领域知识和内部问题上下文,并利用最新的 LLM 来处理这些任务。通过全面的消融实验和错误分析,我们发现使用 SecBERT 编码器的领域特定训练极大地促进了我们最佳的神经符号模型超越作为基线的 FinQA 论文的顶级模型。这表明了领域特定训练潜在的优越性能。此外,我们最佳的基于提示的 LLM 生成器实现了最先进(SOTA)的性能并有显著提升(>7%),但仍低于人类专家的表现。本研究强调了在较小模型和少样本示例中幻觉损失与外部知识增益之间的权衡。对于较大模型,来自外部事实的增益通常超过幻觉损失。最后,我们的发现证实了针对少样本学习优化的最新 LLM 具有增强的数值推理能力。
引用
@article{arxiv.2512.23848,
title = {Integrating Domain Knowledge for Financial QA: A Multi-Retriever RAG Approach with LLMs},
author = {Yukun Zhang and Stefan Elbl Droguett and Samyak Jain},
journal= {arXiv preprint arXiv:2512.23848},
year = {2026}
}