中文

使用预训练 Transformer 处理长法律文档:改进 LegalBERT 与 Longformer

计算与语言 2022-11-11 v2

摘要

预训练 Transformer 目前主导了大多数自然语言处理(NLP)任务。然而,它们对最大输入长度施加了限制(BERT 中为 512 个子词),这在法律领域过于严格。即便是稀疏注意力模型,如 Longformer 和 BigBird,将最大输入长度提升至 4,096 个子词,在 LexGLUE 的六个数据集中仍有三个会严重截断文本。具有 TF-IDF 特征的更简单线性分类器可处理任意长度文本,训练和部署所需资源少得多,但通常性能不及预训练 Transformer。我们探索了应对长法律文本的两种方向:(i)修改从 LegalBERT 热启动的 Longformer 以处理更长的文本(最多 8,192 个子词);(ii)修改 LegalBERT 以使用 TF-IDF 表示。第一种方法在性能上最佳,超越了 LegalBERT 的分层版本,后者曾是 LexGLUE 中先前的 state of the art。第二种方法以性能降低为代价带来了计算上更高效的模型,但所得模型在长法律文档分类中总体上仍优于带有 TF-IDF 特征的线性 SVM。

关键词

引用

@article{arxiv.2211.00974,
  title  = {Processing Long Legal Documents with Pre-trained Transformers: Modding LegalBERT and Longformer},
  author = {Dimitris Mamakas and Petros Tsotsi and Ion Androutsopoulos and Ilias Chalkidis},
  journal= {arXiv preprint arXiv:2211.00974},
  year   = {2022}
}

备注

9 pages, long paper at NLLP Workshop 2022 proceedings