IndiaFinBench:评估大型语言模型在印度金融监管文本上表现的基准
计算与语言
2026-05-05 v2 人工智能
信息检索
摘要
我们介绍IndiaFinBench,据我们所知,这是第一个公开可用的评估基准,用于评估大型语言模型(LLM)在印度金融监管文本上的表现。现有的金融NLP基准完全源自西方金融语料库(SEC文件、美国收益报告、英语金融新闻),在非西方监管框架的覆盖上留下了显著空白。IndiaFinBench通过从印度证券交易委员会(SEBI)和印度储备银行(RBI)的192份文件中提取的406个专家标注的问答对来填补这一空白,涵盖四种任务类型:监管解释(174项)、数值推理(92项)、矛盾检测(62项)和时间推理(78项)。标注质量通过基于模型的二次验证(矛盾检测的kappa=0.918;150项子集的总体一致性为90.7%)和一项跨三轮标注的180项人工标注者间一致性研究(矛盾检测的kappa=0.645;总体一致性为77.2%;基准覆盖率为44.3%)得到验证。我们在零样本条件下评估了十二个模型,准确率从70.4%(Gemma 4 E4B)到89.7%(Gemini 2.5 Flash)不等。所有模型都显著优于69.0%的非专家人类基线。数值推理是最具区分度的任务,跨模型的准确率差距为35.9个百分点。Bootstrap显著性检验(10,000次重采样)揭示了三个统计上不同的性能层级。数据集、评估代码和所有模型输出可在https://github.com/rajveerpall/IndiaFinBench获取。
引用
@article{arxiv.2604.19298,
title = {IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text},
author = {Rajveer Singh Pall},
journal= {arXiv preprint arXiv:2604.19298},
year = {2026}
}
备注
24 pages, 4 figures, 11 tables. Dataset and evaluation code at https://github.com/rajveerpall/IndiaFinBench