中文

FinNLI:用于多元金融自然语言推理基准测试的新型数据集

计算与语言 2025-04-24 v1 人工智能 机器学习

摘要

我们介绍 FinNLI,这是一个针对多样化金融文本(如 SEC 文件、年度报告和收益通报录音)的金融自然语言推理(FinNLI)基准数据集。我们的数据集框架确保前提-假设对多样化,同时最小化虚假关联。FinNLI 包含 21,304 对,包括一个由金融专家标注的高质量测试集,包含 3,304 个实例。评估显示,域迁移显著降低了通用领域 NLI 性能。预训练模型(PLMs)和大型语言模型(LLMs)基线的最高宏平均 F1 分别为 74.57% 和 78.62%,突显该数据集的难度。意外的是,指令调优后的金融 LLM 表现不佳,表明其可迁移性有限。FinNLI 揭示了当前 LLM 在金融推理方面的弱点,指明了改进的空间。

关键词

引用

@article{arxiv.2504.16188,
  title  = {FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference Benchmarking},
  author = {Jabez Magomere and Elena Kochkina and Samuel Mensah and Simerjot Kaur and Charese H. Smiley},
  journal= {arXiv preprint arXiv:2504.16188},
  year   = {2025}
}