长上下文大语言模型在金融概念上的系统性评估
计算与语言
2024-12-23 v1 人工智能
摘要
长上下文大型语言模型(LC LLMs)有望提升 LLMs 在需要处理和理解长输入文档的真实世界任务中的可靠性。然而,LC LLMs 可靠地利用其不断增长的上下文窗口的能力仍处于研究之中。在本工作中,我们通过创建一个真实的金融新闻数据集,评估了最先进的 GPT-4 系列 LC LLMs 在解决一系列难度递增任务时的性能表现,并将其作为上下文长度、任务难度和关键信息位置等因素的函数。我们的研究结果表明,即使在简单任务中,LC LLMs 在较长上下文长度下也表现出脆弱性,且随着任务复杂度的增加,性能急剧下降。在较长的上下文长度下,这些最先进的模型在遵循指令方面出现灾难性失败,导致退化输出。我们的提示词消融实验还揭示了一个令人遗憾的现象:模型对上下文窗口中任务指令的位置以及微小的 Markdown 格式均持续敏感。最后,我们提倡通过采用 F1(而非召回率)等整体性指标并报告置信区间,对 LC LLMs 进行更严格的评估,从而确保得出稳健且结论性的发现。
引用
@article{arxiv.2412.15386,
title = {Systematic Evaluation of Long-Context LLMs on Financial Concepts},
author = {Lavanya Gupta and Saket Sharma and Yiyun Zhao},
journal= {arXiv preprint arXiv:2412.15386},
year = {2024}
}
备注
Accepted at EMNLP 2024