中文

希腊语立法文本的多粒度法律主题分类

计算与语言 2021-10-01 v1

摘要

在这项工作中,我们研究了希腊语法律文本的分类任务。我们引入并公开了一个基于希腊立法的新型数据集,该数据集包含超过 4.7 万份官方、已分类的希腊立法资源。我们利用该数据集进行实验,并评估了一系列先进方法与分类器,涵盖从传统机器学习、基于 RNN 的方法到最先进的基于 Transformer 的方法。我们表明,具有领域特定词嵌入的循环架构在提供更高整体性能的同时,甚至能与基于 transformer 的模型相竞争。最后,我们表明,前沿的多语言与单语基于 transformer 的模型在分类器排名中位居前列,这使我们质疑将训练单语迁移学习模型作为经验法则的必要性。据我们所知,这是首次在开放研究项目中考虑希腊语法律文本分类任务,而且希腊语总体上是一种 NLP 资源非常有限的语言。

关键词

引用

@article{arxiv.2109.15298,
  title  = {Multi-granular Legal Topic Classification on Greek Legislation},
  author = {Christos Papaloukas and Ilias Chalkidis and Konstantinos Athinaios and Despina-Athanasia Pantazi and Manolis Koubarakis},
  journal= {arXiv preprint arXiv:2109.15298},
  year   = {2021}
}

备注

8 pages, long paper at NLLP Workshop 2021 proceedings