INS-MMBench:评估大型视觉语言模型在保险领域性能的综合基准
计算机视觉与模式识别
2025-08-11 v2 人工智能
计算与语言
机器学习
摘要
大型视觉语言模型(LVLMs)和多模态大语言模型(MLLMs)在各种通用多模态应用中展现了卓越的性能,并在专业领域展现出日益增长的潜力。然而,它们在保险领域——以多样化的应用场景和丰富的多模态数据为特征——的潜力在很大程度上仍未得到探索。迄今为止,尚无多模态任务的系统性综述,也没有专门设计用于评估LVLMs在保险领域能力的基准。这一空白阻碍了LVLMs在保险行业的发展。本研究系统性地回顾并分类了四种代表性保险类型(车险、财产险、健康险和农业险)的多模态任务。我们引入了INS-MMBench,这是首个专为保险领域定制的分层基准。INS-MMBench包含22个基础任务、12个元任务和5个场景任务,能够从基本能力到实际应用场景进行全面且递进的评估。我们对11个领先的LVLMs进行了基准测试,包括闭源模型(如GPT-4o)和开源模型(如LLaVA)。我们的评估验证了INS-MMBench的有效性,并提供了关于当前LVLMs在各种保险相关多模态任务上的优势与局限性的详细见解。我们希望INS-MMBench能够加速LVLMs在保险行业的整合,并促进跨学科研究。我们的数据集和评估代码可在https://github.com/FDU-INS/INS-MMBench获取。
引用
@article{arxiv.2406.09105,
title = {INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance},
author = {Chenwei Lin and Hanjia Lyu and Xian Xu and Jiebo Luo},
journal= {arXiv preprint arXiv:2406.09105},
year = {2025}
}
备注
To appear in the International Conference on Computer Vision, ICCV 2025