语言模型在预训练期间是否习得了法律实体类型知识?
计算与语言
2023-10-23 v1
摘要
语言模型(LMs)已证明其能在预训练阶段获取多样的语言知识,有望作为下游任务中一种有价值的附带监督来源。然而,关于领域特定知识尤其是法律知识的获取研究仍较为有限。我们提出以实体类型标注(Entity Typing)任务作为评估法律知识的代理,将其视为文本理解的关键方面,也是众多下游法律 NLP 应用的基础任务。通过系统性评估与分析,采用两类提示(完形填空句与基于问答的模板),并厘清这些习得线索的本质,我们比较了通用与领域特定、不同语义或句法信号、不同 LM 预训练语料(通用与法律导向)及架构(基于编码器 BERT 与仅解码器 Llama2)下的多样类型与长度实体。我们表明:(1)Llama2 在特定实体上表现良好,且经优化提示模板后具备显著提升潜力;(2)法律导向 LMs 表现不一致,可能源于训练语料差异;(3)LMs 即便对多词元实体也能进行类型标注;(4)所有模型均难以处理属法律子领域的实体;(5)Llama2 常忽视句法线索,而基于 BERT 的架构较少存在此缺陷。
引用
@article{arxiv.2310.13092,
title = {Do Language Models Learn about Legal Entity Types during Pretraining?},
author = {Claire Barale and Michael Rovatsos and Nehal Bhuta},
journal= {arXiv preprint arXiv:2310.13092},
year = {2023}
}
备注
Accepted for publication at the 5th Natural Legal Language Processing Workshop (NLLP) hosted at EMNLP2023