中文

基于 Transformer 的实体法律形式分类

计算与语言 2023-10-20 v1 机器学习

摘要

我们提出应用基于 Transformer 的语言模型从原始法律实体名称分类实体法律形式。具体而言,我们采用多种 BERT 变体,并将其性能与多个传统基线比较。我们的评估涵盖大量自由可用的法律实体标识符(LEI)数据子集,包含来自 30 个不同法律辖区的逾 110 万法律实体。各辖区的分类真值标签取自实体法律形式(ELF)代码标准(ISO 20275)。我们的发现表明,预训练 BERT 变体在 F1 分数上优于传统文本分类方法,同时在宏 F1 分数上也表现相当。此外,在十个选定辖区进行的第三方专家评审结果支持了我们提案的有效性。本研究突出了基于 Transformer 的模型在推进数据标准化与数据集成方面的显著潜力。所提方法可极大惠及金融机构、企业、政府及其他组织,以评估业务关系、理解风险敞口并促进有效治理。

关键词

引用

@article{arxiv.2310.12766,
  title  = {Transformer-based Entity Legal Form Classification},
  author = {Alexander Arimond and Mauro Molteni and Dominik Jany and Zornitsa Manolova and Damian Borth and Andreas G. F. Hoepner},
  journal= {arXiv preprint arXiv:2310.12766},
  year   = {2023}
}