InsQABench:面向中文保险领域的大语言模型问答基准
计算与语言
2025-01-22 v1 人工智能
摘要
大语言模型 (Large Language Models, LLMs) 在各个领域取得了显著的成功,但其在专业领域如中文保险行业中的有效性仍未得到充分探索。保险知识涵盖了专业术语和多样化数据类型,对模型和用户都提出了重大挑战。为此,我们引入 InsQABench,这是一个针对中文保险行业的基准数据集,结构分为三个类别:保险常识知识、保险结构化数据库和保险非结构化文档,反映了现实世界的保险问答任务。我们还提出了两种方法,SQL-ReAct 和 RAG-ReAct,以解决结构化和非结构化数据任务中的挑战。评估显示,尽管 LLMs 在处理领域特定术语和细腻条款文本方面存在困难,但在 InsQABench 上进行微调后,性能得到了显著提升。我们的基准为推动 LLMs 在保险领域的应用奠定了坚实基础,数据和代码已在 https://github.com/HaileyFamo/InsQABench.git 上提供。
引用
@article{arxiv.2501.10943,
title = {InsQABench: Benchmarking Chinese Insurance Domain Question Answering with Large Language Models},
author = {Jing Ding and Kai Feng and Binbin Lin and Jiarui Cai and Qiushi Wang and Yu Xie and Xiaojin Zhang and Zhongyu Wei and Wei Chen},
journal= {arXiv preprint arXiv:2501.10943},
year = {2025}
}