中文

面向LLM驱动的金融多智能体系统可靠评估:分类体系、协调优先性与成本意识

多智能体系统 2026-03-31 v1 人工智能 计算工程、金融与科学

摘要

基于大语言模型(LLM)的金融交易多智能体系统自 2023 年以来迅速发展,但该领域缺乏理解什么驱动性能或可信地评估声明的共享框架。本综述做出了三项贡献。第一,我们引入了一个四维分类体系,涵盖架构模式、协调机制、记忆架构和工具集成;应用于 12 个多智能体系统和两个单智能体基线。第二,我们提出了协调优先性假设(CPH):智能体间协调协议设计是交易决策质量的主要驱动因素,其影响力通常超过模型缩放。CPH 被表述为一个可证伪的研究假设,由分层结构证据支持,而非经验验证的结论;其确定性验证需要该领域尚不存在的评估基础设施。第三,我们记录了五种普遍存在的评估失败(前瞻偏差、幸存者偏差、回测过拟合、交易成本忽视和体制转换盲点),并表明这些可能反转报告收益的符号。在 CPH 和评估批评的基础上,我们引入了协调盈亏平衡价差(CBS),一个用于确定多智能体协调是否在交易成本净扣除后增加真实价值的指标,并提出了验证 CPH 的最低评估标准作为前提条件。

关键词

引用

@article{arxiv.2603.27539,
  title  = {Toward Reliable Evaluation of LLM-Based Financial Multi-Agent Systems: Taxonomy, Coordination Primacy, and Cost Awareness},
  author = {Phat Nguyen and Thang Pham},
  journal= {arXiv preprint arXiv:2603.27539},
  year   = {2026}
}

备注

Accepted at the DMO-FinTech Workshop, PAKDD 2026, Hong Kong