中文

InternLM-Law:面向中文法律领域的开源法律大语言模型

计算与语言 2024-06-24 v1

摘要

尽管大型语言模型(LLM)展示了惊人的能力,但它们在应对法律查询方面仍存在挑战,这需要法律领域的复杂性和专业知识。本文介绍了 InternLM-Law,这是一个专为解决与中国法律相关的各种查询而设计的专业LLM,涵盖从回应标准法律问题(例如教科书中的法律练习题)到分析复杂现实法律情形。我们 meticulously 构建了一个覆盖超过 100 万条查询的中文法律领域数据集,并实现了数据筛选和处理管道,以确保其多样性和质量。我们的训练方法包括一个新颖的两阶段过程:首先在法律专用内容和通用内容上进行微调,以赋予模型广泛的知识,随后仅在高质量法律数据上进行微调,以增强结构化输出生成。InternLM-Law 在 LawBench 上取得最高的平均性能,在 20 个子任务中超过了包括 GPT-4 在内的前沿模型。我们将 InternLM-Law 及其数据集公开,以促进未来在法律领域应用 LLM 的研究。

关键词

引用

@article{arxiv.2406.14887,
  title  = {InternLM-Law: An Open Source Chinese Legal Large Language Model},
  author = {Zhiwei Fei and Songyang Zhang and Xiaoyu Shen and Dawei Zhu and Xiao Wang and Maosong Cao and Fengzhe Zhou and Yining Li and Wenwei Zhang and Dahua Lin and Kai Chen and Jidong Ge},
  journal= {arXiv preprint arXiv:2406.14887},
  year   = {2024}
}

备注

Our dataset, code and models will be released at https://github.com/InternLM/InternLM-Law