中国劳动法大语言模型基准测试
人工智能
2026-01-16 v1
摘要
大语言模型(LLM)的最新进展推动了特定领域应用的显著进步,尤其是在法律领域。然而,像 GPT-4 这样的通用模型在需要精确法律知识、复杂推理和语境敏感性的专业子领域中往往表现不佳。为解决这些局限性,我们提出了 LabourLawLLM,一个专为中国劳动法量身定制的法律大语言模型。我们还引入了 LabourLawBench,一个涵盖多种劳动法任务的综合基准测试,包括法律条文引用、基于知识的问答、案例分类、赔偿计算、命名实体识别和法律案例分析。我们的评估框架结合了客观指标(如 ROUGE-L、准确率、F1 和 soft-F1)与基于 GPT-4 评分的主观评估。实验表明,LabourLawLLM 在各类任务中均持续优于通用模型和现有的法律专用 LLM。除劳动法外,我们的方法为在其他法律子领域构建专用 LLM 提供了一种可扩展的途径,从而提升法律 AI 应用的准确性、可靠性和社会价值。
引用
@article{arxiv.2601.09972,
title = {Chinese Labor Law Large Language Model Benchmark},
author = {Zixun Lan and Maochun Xu and Yifan Ren and Rui Wu and Jianghui Zhou and Xueyang Cheng and Jianan Ding Ding and Xinheng Wang and Mingmin Chi and Fei Ma},
journal= {arXiv preprint arXiv:2601.09972},
year = {2026}
}