PortBench:面向大语言模型驱动投资组合管理的相关性感知全流程基准
人工智能
2026-05-28 v1 投资组合管理
摘要
大语言模型在多种金融任务中展现出强大性能,然而投资组合管理——一项关键的金融决策任务——仍缺乏良好的基准测试。现有基准存在两个主要差距:它们忽略了跨资产相关性结构,从而无法区分真正多样化的投资组合与集中化的投资组合;并且未能评估真实场景中完整的投资组合管理决策流程。我们引入了PortBench,一个跨越十年、涵盖六类异质资产类别的基准。PortBench由两个互补的层级组成:一个包含6,269个基于相关性的问题、跨越七个任务模板的静态问答数据集,以及一个模拟完整投资组合管理决策周期的动态五阶段配置流程。为评估这些层级,我们引入了两个专用指标:一个双层相关性分数,用于衡量所提出的投资组合是否利用了跨类别对冲并避免了类别内集中;以及CEPS,一个量化推理错误如何在流程各阶段累积的指标。我们进一步在三种历史压力情景和风险偏好下评估了策略稳健性和投资者一致性。评估了十个前沿大语言模型后,我们发现,尽管在静态金融问答上表现强劲,但90%的模型-偏好组合未能超越基本的等权重分配,并且满足所有程序约束的模型在压力下仍遭受灾难性回撤。我们的源代码可在\href{https://github.com/AgenticFinLab/portbench}{此https URL}获取。
引用
@article{arxiv.2605.27887,
title = {PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management},
author = {Yuxuan Zhao and Sijia Chen and Ningxin Su},
journal= {arXiv preprint arXiv:2605.27887},
year = {2026}
}