大型语言模型通过特许会计师考试
计算与语言
2025-06-27 v1 人工智能
摘要
先进的智能系统,特别是 Large Language Models (LLMs),正通过 Natural Language Processing (NLP) 的进步显著重塑金融实践。然而,这些模型在多大程度上能够有效捕获并应用特定领域的金融知识仍不确定。针对广阔的印度金融背景中的一个关键空白,本文提出了 CA-Ben,这是一个特许会计师基准,专门设计用于评估 LLM 的金融、法律和定量推理能力。CA-Ben 包含源自印度特许会计师协会(ICAI)进行的严格考试的结构化问答数据集,涵盖基础、中级和高级 CA 课程阶段。我们使用标准化协议评估了六个著名的 LLM,即 GPT 4o、LLAMA 3.3 70B、LLAMA 3.1 405B、MISTRAL Large、Claude 3.5 Sonnet 和 Microsoft Phi 4。结果表明性能存在差异,其中 Claude 3.5 Sonnet 和 GPT-4o 优于其他模型,特别是在概念和法律推理方面。在数值计算和法律解释方面出现了显著的挑战。研究结果强调了当前 LLM 的优势和局限性,建议通过混合推理和检索增强生成方法进行未来改进,特别是对于定量分析和准确的法律解释。
引用
@article{arxiv.2506.21031,
title = {Large Language Models Acing Chartered Accountancy},
author = {Jatin Gupta and Akhil Sharma and Saransh Singhania and Mohammad Adnan and Sakshi Deo and Ali Imam Abidi and Keshav Gupta},
journal= {arXiv preprint arXiv:2506.21031},
year = {2025}
}
备注
Accepted for publication at MoStart 2025: International Conference on Digital Transformation in Education and Applications of Artificial Intelligence, Bosnia and Herzegovina, 2025