金融指令遵循评估(FIFE)
机器学习
2025-12-11 v1 人工智能
计算与语言
摘要
语言模型(LMs)在处理复杂且相互依赖的指令时存在困难,尤其是在金融等精度至关重要的高风险领域。我们引入 FIFE,一个新型的高难度基准,用于评估语言模型在金融分析任务中的指令遵循能力。FIFE 包含 88 个人工编写的提示,并采用具有可链式验证约束的验证系统,以提供细粒度的奖励信号。我们在零样本设置下评估了 53 个模型(专有模型、开放权重模型和开源模型)。我们的关键发现揭示了一个清晰的性能层次:领先的开放权重模型(严格 76.1 / 宽松 79.5)超越了领先的专有系统(严格 65.9 / 宽松 70.5),而最佳开源模型则显著落后(严格 45.5 / 宽松 48.9)。然而,即使表现最好的模型也难以满足 FIFE 的复杂要求,无法实现完全合规。我们将数据集和代码作为开源资源发布,以促进金融领域的强化学习研究。
引用
@article{arxiv.2512.08965,
title = {Financial Instruction Following Evaluation (FIFE)},
author = {Glenn Matlin and Siddharth and Anirudh JM and Aditya Shukla and Yahya Hassan and Sudheer Chava},
journal= {arXiv preprint arXiv:2512.08965},
year = {2025}
}
备注
Accepted at NeurIPS 2025 Generative AI in Finance Workshop (GenAI Finance), San Diego. Camera-ready version. Code and data: https://github.com/gtfintechlab/FIFE/