中文

哪些因素影响 LLM 和 RLLM 在金融问答中的表现?

计算与语言 2026-04-14 v4

摘要

最近,大型语言模型 (LLM) 和推理大型语言模型 (RLLM) 受到众多研究者的关注。RLLM 通过长链思考 (Long CoT) process 提升了推理能力,在解决复杂问题方面显著提升了 LLM 的性能。然而,目前缺乏系统性地探讨哪些方法能充分发挥 LLM 和 RLLM 在金融领域的潜力。为此,我们使用五个 LLM 和四个 RLLM 来评估提示方法、代理框架和多语言对齐方法对金融问答任务的影响。我们的研究发现:(1) 当前的提示方法和代理框架通过模拟 Long CoT 来提升 LLM 在金融问答中的性能;(2) RLLM 具备内在的 Long CoT 能力,这限制了常规方法进一步提升其性能的效果;(3) 当前先进的多语言对齐方法主要通过延长推理长度来提升 LLM 的多语言性能,对 RLLM 的益处有限。此外,我们讨论了提升 LLM 和 RLLM 在金融问答中性能的策略,或可为未来改进提供 inspiration。我们希望本研究为 LLM 和 RLLM 在金融问答领域提供重要参考。

关键词

引用

@article{arxiv.2507.08339,
  title  = {What Factors Affect LLMs and RLLMs in Financial Question Answering?},
  author = {Peng Wang and Xuesi Hu and Jiageng Wu and Yuntao Zou and Qiancheng Zhang and Dagang Li},
  journal= {arXiv preprint arXiv:2507.08339},
  year   = {2026}
}

备注

Accepted by ACL 2026 Findings