WisdomInterrogatory(LuWen):一个开源法律大语言模型技术报告
计算与语言
2026-04-13 v2 人工智能
摘要
大语言模型在广泛自然语言处理任务上展现了显著能力,然而其在法律领域的应用仍具有挑战性,原因在于法律领域涉及专业术语、复杂推理要求以及快速演变的法律知识。在本文中,我们提出了WisdomInterrogatory(LuWen),一个基于Baichuan基础模型构建的开源中文法律语言模型,通过三种关键技术实现:在大规模法律语料上的持续预训练、经过精心策划的法律指令数据的监督微调,以及与综合法律知识库集成的检索增强生成。我们在五个代表性法律任务上评估了LuWen,涵盖预测和生成两种设置,包括法律判决预测、司法考试、法律文本摘要、法律条文问答和司法决策推理。实验结果表明,LuWen优于多个强基线,证明了我们的方法在将通用语言模型适配到法律领域的有效性。
引用
@article{arxiv.2604.06737,
title = {WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report},
author = {Yiquan Wu and Yuhang Liu and Yifei Liu and Ang Li and Siying Zhou and Kun Kuang and Fei Wu},
journal= {arXiv preprint arXiv:2604.06737},
year = {2026}
}
备注
10 pages, 4 figures