中文

基于BERT技术的美国最高法院案例分类

计算与语言 2023-07-25 v3 人工智能 机器学习

摘要

基于双向编码器表示来自变换器(BERT)的模型在许多自然语言处理(NLP)任务(如命名实体识别(NER)、词性(POS)标注等)上取得了当前最优(SOTA)结果。在对如美国最高法院判决书这类长文档进行分类时,会出现一种有趣的现象:基于BERT的模型在初次使用或开箱即用时被认为难以应用。本文中,我们尝试了若干基于BERT的分类技术用于美国最高法院判决或最高法院数据库(SCDB),并与先前SOTA结果进行比较。随后我们将自身结果专门与面向长文档的SOTA模型比较。我们对两项分类任务的结果进行了比较:(1)含15个类别的粗粒度分类任务;(2)含279个类别的细粒度分类任务。我们的最佳结果在15个粗粒度类别上达到80%准确率,在279个细粒度类别上达到60%准确率,相较先前报道的SOTA结果分别提升了8%和28%。

关键词

引用

@article{arxiv.2304.08649,
  title  = {Classification of US Supreme Court Cases using BERT-Based Techniques},
  author = {Shubham Vatsal and Adam Meyers and John E. Ortega},
  journal= {arXiv preprint arXiv:2304.08649},
  year   = {2023}
}