中文

ActuBench:用于精算推理任务生成与评估的多智能体大语言模型流水线

人工智能 2026-04-23 v1 计算与语言

摘要

我们提出了ActuBench,一个多智能体大语言模型(LLM)流水线,用于自动生成和评估与国际精算协会(IAA)教育大纲相符的高级精算评估题目。该流水线通过适配器分离了四个LLM角色:一个智能体起草题目,一个构建干扰项,第三个独立验证这两个阶段并驱动有界的一次性修复循环,以及一个成本优化的辅助智能体处理维基百科笔记摘要和主题标记。这些题目、每个模型的响应以及完整的排行榜以可浏览的网页界面发布在https://actubench.de/en/,允许读者和从业者无需检出仓库即可检查单个题目。我们在两个互补的基准测试——100个经验上最难的单项选择题和100个由LLM评判员评分的开放题——上评估了来自八个提供商的50个语言模型,并报告了三个主要发现。首先,多智能体验证是承重环节:独立验证器在首次通过时标记了大多数起草的题目,其中大部分通过一次性修复循环解决。其次,本地托管开放权重推理位于成本-性能帕累托前沿:在消费级硬件上运行的Gemma~4模型和Ceresbas托管的120B开放权重模型主导了近零成本区域,后者与排行榜顶部的差距在一个题目之内。第三,MCQ和LLM作为评判员的排名存在显著差异:MCQ框架抬高了性能上限,而评判员模式评估对于区分前沿模型是必要的。

关键词

引用

@article{arxiv.2604.20273,
  title  = {ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks},
  author = {Jan-Philipp Schmidt},
  journal= {arXiv preprint arXiv:2604.20273},
  year   = {2026}
}

备注

19 pages, 4 figures, 4 tables