提取、匹配与评分:金融分析中长问题-上下文-答案三元组的评估范式
计算与语言
2025-03-24 v1 人工智能
摘要
大型语言模型(LLMs)的快速发展引发了其在各种应用中的广泛采用,这使得稳健的评估框架对于评估其性能至关重要。虽然传统的评估指标适用于较短的文本,但在评估长形式答案的质量时,其效力会减弱。这一局限性在涉及扩展问题、广泛上下文和长形式答案的现实场景中尤为关键,例如金融分析或法规遵从。在本文中,我们使用一个实际的金融用例来说明处理“长问题-上下文-答案三元组”的应用。我们构建了一个包含长三元组的真实世界金融数据集,并证明了传统指标的不足。为了解决这个问题,我们提出了一种有效的“提取、匹配和评分”(Extract, Match, and Score, EMS)评估方法,该方法针对长形式LLM输出的复杂性量身定制,为从业者提供了一种可靠的方法来评估LLM在复杂现实场景中的性能。
引用
@article{arxiv.2503.16575,
title = {Extract, Match, and Score: An Evaluation Paradigm for Long Question-context-answer Triplets in Financial Analysis},
author = {Bo Hu and Han Yuan and Vlad Pandelea and Wuqiong Luo and Yingzhu Zhao and Zheng Ma},
journal= {arXiv preprint arXiv:2503.16575},
year = {2025}
}