中文

面向法律领域的预训练语言模型:以印度法律为例的研究

计算与语言 2023-05-16 v5 人工智能 机器学习

摘要

随着基于 Transformer 的、在法律文本上预训练的语言模型(PLM)的出现,法律领域自然语言处理(NLP)取得了日益增长的成效。基于欧洲与美国法律文本训练的 PLM 已公开可用;然而,其他法域(国家)如印度的法律文本具有诸多区别性特征。随着各国法律 NLP 应用数量的迅速增长,在这些其他国家的法律文本上预训练此类 LM 也变得必要。本工作中,我们尝试考察印度法律领域的预训练。我们在印度法律数据上对两个广用的法律 PLM——LegalBERT 与 CaseLawBERT——进行再训练(继续预训练),并基于印度法律文本的词表从零训练一个模型。我们将这些 PLM 应用于三项基准法律 NLP 任务——基于事实的法律条文识别、法庭判决文书的语义分割,以及上诉判决预测——涵盖印度与非印度(欧盟、英国)数据集。我们观察到,我们的方法不仅提升了在新法域(印度文本)上的表现,也提升了在原法域(欧洲与英国文本)上的表现。我们还进行了可解释性实验,以对所有这些不同 PLM 作定性比较。

关键词

引用

@article{arxiv.2209.06049,
  title  = {Pre-trained Language Models for the Legal Domain: A Case Study on Indian Law},
  author = {Shounak Paul and Arpan Mandal and Pawan Goyal and Saptarshi Ghosh},
  journal= {arXiv preprint arXiv:2209.06049},
  year   = {2023}
}

备注

To be published in the 19th International Conference on Artificial Intelligence and Law - ICAIL 2023