中文

Lawformer:面向中文法律长文档的预训练语言模型

计算与语言 2021-05-11 v1

摘要

法律人工智能(LegalAI)旨在利用人工智能技术,特别是自然语言处理(NLP)技术,为法律体系带来益处。近来,受预训练语言模型(PLM)在通用领域成功的启发,许多法律人工智能研究者致力于将 PLM 应用于法律任务。然而,利用 PLM 解决法律任务仍具挑战性,因为法律文档通常由数千个词符组成,远长于主流 PLM 所能处理的长度。本文发布基于 Longformer 的预训练语言模型,命名为 Lawformer,用于中文法律长文档理解。我们在多种法律人工智能任务上评估 Lawformer,包括判决预测、类案检索、法律阅读理解和法律问答。实验结果表明,我们的模型在以长文档为输入的任务上能取得可观的提升。

关键词

引用

@article{arxiv.2105.03887,
  title  = {Lawformer: A Pre-trained Language Model for Chinese Legal Long Documents},
  author = {Chaojun Xiao and Xueyu Hu and Zhiyuan Liu and Cunchao Tu and Maosong Sun},
  journal= {arXiv preprint arXiv:2105.03887},
  year   = {2021}
}