中文

SAHM:面向阿拉伯语金融与查希亚合规推理的基准数据集

计算与语言 2026-05-04 v2 人工智能 机器学习

摘要

尽管英语金融自然语言处理领域通过针对盈利分析、市场情感、表格推理和金融问答的基准测试实现了快速进展,但阿拉伯语金融NLP几乎不存在,鉴于4.22亿说话人、4.9万亿美元的阿拉伯联合国巴基斯坦主权财富,以及4-5万亿美元的伊斯兰金融产业需要针对sukuk、murabaha、takaful等金融工具进行专业查希亚合规。我们引入Sahm——首个覆盖七个任务的阿拉伯语金融基准数据集:AAOIFI标准问答、法顾问答/选择题、会计与商业考试、金融情感分析、抽取式摘要、事件-原因推理,包含14,380个来自真实监管、司法和公司来源的专家验证实例。评估了20个大语言模型,我们发现阿拉伯语流畅度并不等同于金融推理:在识别任务上达91%的模型在生成任务中表现急剧下降,事件-原因推理暴露了最宽泛的性能差距(1.89-9.84/10)。我们发布基准数据集以支持可信赖的阿拉伯语金融助手。

关键词

引用

@article{arxiv.2604.19098,
  title  = {SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning},
  author = {Rania Elbadry and Sarfraz Ahmad and Ahmed Heakl and Dani Bouch and Momina Ahsan and Muhra AlMahri and Marwa Elsaid khalil and Yuxia Wang and Salem Lahlou and Sophia Ananiadou and Veselin Stoyanov and Jimin Huang and Xueqing Peng and Preslav Nakov and Zhuohan Xie},
  journal= {arXiv preprint arXiv:2604.19098},
  year   = {2026}
}

备注

29 page