MEL: 法语语言模型
计算与语言
2025-01-28 v1
摘要
法律文本因其复杂的专业术语而构成语言模型的重大挑战。将这种欠代表型语言——西班牙语——纳入模型更为困难。虽然像 XLM-RoBERTa 这样的预训练模型在处理多语言语料方面表现出色,但其在特定领域文档上的性能仍未得到充分探索。本文介绍了 MEL(基于 XLM-RoBERTa-large 微调的法律语言模型),其在法律文档(如西班牙官方法令《 Boletín Oficial del Estado》及国会文本)上进行训练与评估。我们详细阐述了数据收集、处理、训练与评估过程。评估基准显示,该模型在理解西班牙语法律文本方面显著优于基线模型。我们还展示了案例研究,说明该模型在处理新法律文本时的应用潜力,突出其在不同 NLP 任务中取得优异成绩的能力。
引用
@article{arxiv.2501.16011,
title = {MEL: Legal Spanish Language Model},
author = {David Betancur Sánchez and Nuria Aldama García and Álvaro Barbero Jiménez and Marta Guerrero Nieto and Patricia Marsà Morales and Nicolás Serrano Salas and Carlos García Hernán and Pablo Haya Coll and Elena Montiel Ponsoda and Pablo Calleja Ibáñez},
journal= {arXiv preprint arXiv:2501.16011},
year = {2025}
}
备注
8 pages, 6 figures, 3 tables