中文

verBERT:利用BERT自动化巴西判例法文档多标签分类

机器学习 2022-03-15 v1

摘要

本工作中,我们研究了基于注意力的算法在自动化巴西判例法文档分类中的使用。我们使用来自Kollemata项目的数据生成了两个具有适当类别系统的不同数据集。随后,我们实现了BERT的多类与多标签版本,并用所生成的数据集微调了不同的BERT模型。我们评估了若干指标,采用微平均F1分数作为主指标,获得了F1-micro=0.72的性能值,相对于所测试的统计基线有30个百分点的提升。本工作中,我们研究了基于注意力的算法在自动化巴西判例法文档分类中的使用。我们使用来自\textit{Kollemata}项目的数据生成了两个具有适当类别系统的不同数据集。随后,我们实现了BERT的多类与多标签版本,并用所生成的数据集微调了不同的BERT模型。我们评估了若干指标,采用微平均F1分数作为主指标,获得了F1micro=0.72\langle \mathcal{F}_1 \rangle_{micro}=0.72的性能值,相对于所测试的统计基线有30个百分点的提升。

关键词

引用

@article{arxiv.2203.06224,
  title  = {verBERT: Automating Brazilian Case Law Document Multi-label Categorization Using BERT},
  author = {Felipe R. Serras and Marcelo Finger},
  journal= {arXiv preprint arXiv:2203.06224},
  year   = {2022}
}

备注

10 pages, 2 tables