中文

INSEva:面向保险领域大语言模型的综合中文基准

计算与语言 2025-09-08 v1

摘要

保险作为全球金融体系的关键组成部分,在人工智能应用中要求极高的准确性和可靠性标准。尽管现有基准评估了人工智能在各个领域的能力,但它们往往未能捕捉保险领域的独特特征和需求。为了填补这一空白,我们提出了 INSEva,这是一个专门为评估人工智能系统在保险领域的知识和能力而设计的综合中文基准。INSEva 具有多维评估分类体系,涵盖业务领域、任务格式、难度级别和认知-知识维度,包含来源于权威材料的 38,704 个高质量评估样本。我们的基准实现了量身定制的评估方法,以评估开放式回答中的忠实性和完整性。通过对 8 个最先进的大语言模型(LLM)的广泛评估,我们发现了不同维度上的显著性能差异。虽然通用 LLM 表现出基本的保险领域能力,平均得分在 80 分以上,但在处理复杂的现实保险场景方面仍存在巨大差距。该基准即将公开发布。

关键词

引用

@article{arxiv.2509.04455,
  title  = {INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance},
  author = {Shisong Chen and Qian Zhu and Wenyan Yang and Chengyi Yang and Zhong Wang and Ping Wang and Xuan Lin and Bo Xu and Daqian Li and Chao Yuan and Licai Qi and Wanqing Xu and sun zhenxing and Xin Lu and Shiqiang Xiong and Chao Chen and Haixiang Hu and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2509.04455},
  year   = {2025}
}

备注

Under review