中文

LawGPT:知识引导的数据生成及其在法律 LLM 中的应用

计算与语言 2025-02-14 v2 人工智能

摘要

大型语言模型(LLM),无论是专有模型还是开源模型,都在 various natural language processing tasks 中展现出惊人的能力。然而,它们在法律推理任务中存在显著局限。专有模型引入数据隐私风险和高昂的推理成本,而开源模型因缺乏足够的法律领域训练数据而表现不佳。为解决这些局限性,我们研究了为法律推理生成数据以提高开源 LLM 的法律推理性能,同时借助专有 LLM。这一任务因缺乏法律知识和难以验证生成数据而具有挑战性。我们提出了 KgDG,即面向法律推理的知识引导数据生成框架。我们的框架利用法律知识来增强生成多样性,并引入细化和验证流程以确保生成数据的质量。此外,我们扩展了生成数据集以进一步提升 LLM 的推理能力。通过 KgDG,我们创建了一个包含 50K 条高质量示例的合成法律推理数据集。我们的训练模型 LawGPT 在现有法律专用 LLM 中取得优异性能,并与专有 LLM 的性能相当,展示了 KgDG 和 LawGPT 的有效性。我们的代码和资源已公开 disponible at https://github.com/LAMDASZ-ML/Knowledge-Guide-Data-Generation。

关键词

引用

@article{arxiv.2502.06572,
  title  = {LawGPT: Knowledge-Guided Data Generation and Its Application to Legal LLM},
  author = {Zhi Zhou and Kun-Yang Yu and Shi-Yu Tian and Xiao-Wen Yang and Jiang-Xin Shi and Pengxiao Song and Yi-Xuan Jin and Lan-Zhe Guo and Yu-Feng Li},
  journal= {arXiv preprint arXiv:2502.06572},
  year   = {2025}
}

备注

Preprint