中文

自动化难民案件分析:支持法律从业者的 NLP 流水线

计算与语言 2023-11-13 v1

摘要

本文介绍了一个端到端流水线,用于检索、处理并从法律案件中抽取目标信息。我们以加拿大难民法为案例研究,考察了一个未被充分研究的法律领域。对律师和法官(我们原型的潜在终端用户)而言,检索判例法中的过往相似案件是法律工作的关键部分。虽然传统的命名实体识别标签(如日期)在法律工作中提供有意义的信息,我们提议扩展现有模型,从难民案件中抽取共 19 类有用条目。在创建新的案件数据集后,我们基于最先进的神经命名实体识别(NER)进行信息抽取。我们测试了不同架构,包括两个 transformer 模型,使用上下文与非上下文嵌入,并比较通用目的与领域特定的预训练。结果表明,尽管规模更小,在法律数据上预训练的模型表现最佳,说明领域匹配的影响大于网络架构。我们在五个目标类别上取得了超过 90% 的 F1 分数,并在另外四个类别上超过 80%。

关键词

引用

@article{arxiv.2305.15533,
  title  = {Automated Refugee Case Analysis: An NLP Pipeline for Supporting Legal Practitioners},
  author = {Claire Barale and Michael Rovatsos and Nehal Bhuta},
  journal= {arXiv preprint arXiv:2305.15533},
  year   = {2023}
}

备注

9 pages, preprint of long paper accepted to Findings of the Annual Meeting of the Association for Computational Linguistics (ACL) 2023