中文

金融领域评估 LLM 需要显式考虑偏差

机器学习 2026-02-17 v1 人工智能 计算金融

摘要

大语言模型(LLM)日益集成到金融工作流程中,但评估实践未能跟上。金融领域的偏差可能人为地夸大性能、污染回测,并使报告结果对任何部署声称毫无用处。我们识别了金融 LLM 应用中五种常见的偏差,包括:前瞻偏差、存活偏差、叙事偏差、客观偏差和成本偏差。这些偏差以不同方式破坏金融任务,往往相互叠加,制造出有效性的错觉。我们审阅了2023至2025年间164篇论文,发现没有单一偏差在研究中被讨论超过28%。本立场论文认为,金融 LLM 系统的偏差需要获得显式关注,结构有效性应在任何用于支持部署声称的结果之前强制执行。我们提出了结构有效性框架和评估检查清单,列明金融 LLM 系统进行偏差诊断和未来系统设计的最低要求。该材料可在 https://github.com/Eleanorkong/Awesome-Financial-LLM-Bias-Mitigation 查阅。

关键词

引用

@article{arxiv.2602.14233,
  title  = {Evaluating LLMs in Finance Requires Explicit Bias Consideration},
  author = {Yaxuan Kong and Hoyoung Lee and Yoontae Hwang and Alejandro Lopez-Lira and Bradford Levy and Dhagash Mehta and Qingsong Wen and Chanyeol Choi and Yongjae Lee and Stefan Zohren},
  journal= {arXiv preprint arXiv:2602.14233},
  year   = {2026}
}