中文

金融文件处理的多智能体 LLM 架构基准测试:一种编排模式、成本-精度权衡与生产规模策略的比较研究

人工智能 2026-03-25 v1 计算与语言 机器学习

摘要

大型语言模型(LLM)用于从结构化金融文件中提取信息的应用已快速普及,但在实际部署中面临着具有有限实证指导的根本性架构决策。我们 presented a systematical benchmark comparing four multi-agent orchestration architectures: sequential pipeline, parallel fan-out with merge, hierarchical supervisor-worker and reflexive self-correcting loop. 这些架构在五个前沿且开源权重 LLM 上评估,数据集为 10,000 份 SEC 文件(10-K、10-Q 和 8-K 表格)。我们的评估涵盖 25 种提取字段类型,涉及治理结构、高管酬劳和财务指标,沿五个维度进行衡量:字段级 F1 分数、文件级准确率、端到端延迟、每文件成本和 token 效率。我们发现,反射式架构在字段级 F1(0.943)上取得最高分,但成本是顺序基线的 2.3 倍;而层次化架构则在成本-精度帕累托前沿上占据最有利位置(F1 为 0.921,成本为基线的 1.4 倍)。我们进一步提出了关于语义缓存、模型路由和自适应重试策略的消融研究,表明混合配置可在仅增加 1.15 倍基线成本的情况下恢复 89% 的反射式架构精度提升。我们的规模分析从 1K 到 100K 文档/天揭示了具有启发性的吞吐量-精度退化曲线,以为容量规划提供了实用指导。这些发现为在受监管的金融环境中部署多智能体 LLM 系统的实践者提供了可操作的指导。

关键词

引用

@article{arxiv.2603.22651,
  title  = {Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies},
  author = {Siddhant Kulkarni and Yukta Kulkarni},
  journal= {arXiv preprint arXiv:2603.22651},
  year   = {2026}
}