Juru: 基于可靠来源的巴西法律大型语言模型
计算与语言
2025-07-29 v2 人工智能
摘要
与预训练大型语言模型相关的高计算成本限制了其研究。为解决这一问题,出现了两种策略:领域专业化和使用高质量数据进行预训练。为了探索这些策略,我们使用来自巴西可靠法律来源的19亿个独特令牌对Mistral-7B模型进行了专业化,并在法律和通用知识测试套件上进行了少样本评估。我们的模型Juru展示了领域专业化的好处,即使预训练数据量减少,在法律基准测试上也取得了更好的性能。然而,这种通过持续预训练实现的领域专业化是以增加无关领域遗忘为代价的,这在葡萄牙语和英语的通用知识测试套件上的性能下降中得到了证明。这项研究为越来越多的科学证据做出了贡献,表明预训练数据选择可以提高大型语言模型的性能,从而能够以更低的成本探索这些模型。Juru可在https://huggingface.co/roseval/Juru-7B公开获取。
引用
@article{arxiv.2403.18140,
title = {Juru: Legal Brazilian Large Language Model from Reputable Sources},
author = {Roseval Malaquias Junior and Ramon Pires and Roseli Romero and Rodrigo Nogueira},
journal= {arXiv preprint arXiv:2403.18140},
year = {2025}
}