PoliLegalLM: 面向政治与法律事务的大型语言模型技术报告
计算与语言
2026-04-21 v1
摘要
大型语言模型(LLM)在通用领域任务中取得了显著成功,但由于幻觉法律引用、知识覆盖不完整和结构化推理能力弱,其直接应用于法律领域仍然具有挑战性。为了解决这些问题,我们提出了PoliLegalLM,一个为政治和法律应用量身定制的领域特定大型语言模型。我们的方法采用统一的训练框架,整合了持续预训练、渐进式监督微调和基于偏好的强化学习,以共同增强法律知识基础、任务对齐和推理能力。我们构建了一个大规模、高质量的法律语料库,并设计了一个结构化的后训练流水线,使模型能够有效学习领域特定知识并适应各种法律任务。我们在三个代表性基准上评估了PoliLegalLM,包括LawBench、LexEval和一个真实世界数据集PoliLegal。实验结果表明,PoliLegalLM实现了强大且一致的性能,优于类似规模的竞争模型,并与显著更大的模型保持高度竞争力,同时在真实法律场景中取得了最佳结果。这些结果突显了我们训练范式的有效性以及领域特定LLM在真实法律应用中的实用价值。
引用
@article{arxiv.2604.17543,
title = {PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs},
author = {Yuting Huang and Yinghao Hu and Qian Xiao and Wenlin Zhong and Yiquan Wu and Taishi Zhou and Moke Chen and Changlong Sun and Kun Kuang and Fei Wu},
journal= {arXiv preprint arXiv:2604.17543},
year = {2026}
}