LegalRelectra:面向长程法律文本理解的多领域混合语言建模
计算与语言
2022-12-19 v1 计算机与社会
摘要
自然语言处理(NLP)在诸如法律等专门领域的应用近来受到大量关注。由于许多法律服务依赖于处理和分析大量文档集合,用NLP工具自动化此类任务成为一项关键挑战。许多流行的语言模型,如BERT或RoBERTa,是通用目的模型,在处理专门的法律术语和句法方面存在局限。此外,法律文档可能包含来自其他领域的专门词汇,例如人身伤害文本中的医学术语。在此,我们提出LegalRelectra,一种在混合领域的法律和医学语料上训练的法律领域语言模型。我们表明,在处理混合领域(人身伤害)文本时,我们的模型优于通用领域及单一领域的医学和法律语言模型。我们的训练架构实现了Electra框架,但使用Reformer而非BERT作为其生成器和判别器。我们表明这提升了模型处理长段落的性能,并带来更好的长程文本理解。
引用
@article{arxiv.2212.08204,
title = {LegalRelectra: Mixed-domain Language Modeling for Long-range Legal Text Comprehension},
author = {Wenyue Hua and Yuchen Zhang and Zhe Chen and Josie Li and Melanie Weber},
journal= {arXiv preprint arXiv:2212.08204},
year = {2022}
}