世界上第一个保险大型语言模型评估基准的设计、结果与行业影响
计算与语言
2025-11-12 v1
摘要
本文全面详述了CUFEInse v1.0基准的构建方法论、多维评估体系与底层设计理念。遵循“量化导向、专家驱动、多重验证”原则,该基准构建了覆盖保险理论知识、行业认知、安全合规、智能体应用与逻辑严谨性等5个核心维度、54个子指标、14,430道高质量题目的评估框架。基于该基准,对11个主流大型语言模型进行了全面评估。评估结果揭示,通用模型存在 actuarial 能力弱、合规适配不足等普遍瓶颈;高质量领域特定训练在保险垂直场景中展现出显著优势,但在业务适配性和合规性方面存在不足。该评估还准确识别了当前大型模型在保险精算、保险开发与理赔推理等专业场景中的常见瓶颈。CUFEInse的建立不仅填补了保险领域专业评估基准的空白,为学术界和行业界提供了专业、系统、权威的评估工具,同时其构建概念与方法论为垂直领域大型语言模型评估范式提供了重要参考,作为学术模型优化和产业模型选型的权威参考。最后,本文展望了该评估基准的未来迭代方向,以及面向保险大型语言模型的“领域适应+推理增强”核心发展方向。
引用
@article{arxiv.2511.07794,
title = {Design, Results and Industry Implications of the World's First Insurance Large Language Model Evaluation Benchmark},
author = {Hua Zhou and Bing Ma and Yufei Zhang and Yi Zhao},
journal= {arXiv preprint arXiv:2511.07794},
year = {2025}
}
备注
16 pages, 11 models,1 set of evaluation framework,5 core dimensions, 54 sub-indicators, 14,430 high-quality questions