从评分到技能:面向金融大型语言模型的认知诊断评估框架
计算工程、金融与科学
2025-08-26 v2
摘要
大型语言模型(LLMs)在金融应用中显示出前景,但由于现有基准不足,仍不成熟。现有基准仅依赖 score-level(评分层面)评估,用单个评分概括性能,掩盖了模型真正了解什么以及其精确局限性。此外,这些基准使用的数据集仅覆盖金融概念的狭窄子集,忽略了现实应用中其他必需品。为此,我们提出FinCDM,即首个针对金融大型语言模型的认知诊断评估框架,使其能够在知识-技能层面进行评估,基于模型在 skill-tagged(技能标记)任务中的响应模式识别其拥有或缺乏的金融技能和知识,而非单一的聚合数字。我们构建CPA-KQA,首个源自注册会计师(CPA)考试的认知感知金融评估数据集,全面覆盖现实世界的会计和金融技能。数据集由领域专家进行严格标注,专家编写、验证和标注问题,确保高的 inter-annotator agreement(标注者间一致性)和细粒度知识标签。我们对 30 个专有、开源和领域特定 LLMs 进行大量实验,结果表明FinCDM 揭示了隐藏的知识缺口,识别了如税务和监管推理等在传统基准中未被充分测试的领域,以及模型之间的行为聚类。FinCDM 引入了金融 LLM 评估的新范式,通过实现可解释、技能感知的诊断,支持更可信和有针对性的模型开发,所有数据集和评估脚本将公开发布以支持进一步研究。
引用
@article{arxiv.2508.13491,
title = {From Scores to Skills: A Cognitive Diagnosis Framework for Evaluating Financial Large Language Models},
author = {Ziyan Kuang and Feiyu Zhu and Maowei Jiang and Yanzhao Lai and Zelin Wang and Zhitong Wang and Meikang Qiu and Jiajia Huang and Min Peng and Qianqian Xie and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2508.13491},
year = {2025}
}