希腊语立法文本的多粒度法律主题分类
计算与语言
2021-10-01 v1
摘要
在这项工作中,我们研究了希腊语法律文本的分类任务。我们引入并公开了一个基于希腊立法的新型数据集,该数据集包含超过 4.7 万份官方、已分类的希腊立法资源。我们利用该数据集进行实验,并评估了一系列先进方法与分类器,涵盖从传统机器学习、基于 RNN 的方法到最先进的基于 Transformer 的方法。我们表明,具有领域特定词嵌入的循环架构在提供更高整体性能的同时,甚至能与基于 transformer 的模型相竞争。最后,我们表明,前沿的多语言与单语基于 transformer 的模型在分类器排名中位居前列,这使我们质疑将训练单语迁移学习模型作为经验法则的必要性。据我们所知,这是首次在开放研究项目中考虑希腊语法律文本分类任务,而且希腊语总体上是一种 NLP 资源非常有限的语言。
引用
@article{arxiv.2109.15298,
title = {Multi-granular Legal Topic Classification on Greek Legislation},
author = {Christos Papaloukas and Ilias Chalkidis and Konstantinos Athinaios and Despina-Athanasia Pantazi and Manolis Koubarakis},
journal= {arXiv preprint arXiv:2109.15298},
year = {2021}
}
备注
8 pages, long paper at NLLP Workshop 2021 proceedings