中文

SynLexLM:利用合成数据和课程学习扩展法律 LLMs

计算与语言 2025-05-01 v2 机器学习

摘要

大型语言模型(LLMs)强大但通常需要大量微调和大数据集才能适用于像法律这样的专业领域。通用预训练可能无法捕捉法律细微差别,获取足够法律数据具有挑战性。我们提出 SynLexLM,一种高效预训练法律 LLM 的新方法。我们的 方法采用课程学习,逐步从简单法律文本和查询过渡到复杂文本,结合使用类似 Gemini Pro 的模型进行数据增强,以解决数据稀缺问题。我们的目标是实现在法律基准测试(BigLaw-Bench、EUR-Lex-Sum)上比传统模型和微调版本取得更好性能。初步工作涉及生成反映法律推理的合成 QA 对。该工作旨在增强法律文档分析和研究工具, potentially democratizing access to advanced legal AI。

关键词

引用

@article{arxiv.2504.18762,
  title  = {SynLexLM: Scaling Legal LLMs with Synthetic Data and Curriculum Learning},
  author = {Ojasw Upadhyay and Abishek Saravanakumar and Ayman Ismail},
  journal= {arXiv preprint arXiv:2504.18762},
  year   = {2025}
}

备注

9 pages, 4 figures, 4 tables