法律程序状态预测:基于序列文本数据的方法
计算与语言
2021-06-24 v4 机器学习
机器学习
摘要
本文的目标是开发预测模型,将巴西法律程序分为三种可能的状态类别:(i)归档程序、(ii)活跃程序以及(iii)中止程序。该问题的解决旨在协助公共与私人机构管理大规模法律程序组合,带来规模与效率上的收益。在本文中,法律程序由称为“动议”的短文本序列构成。我们结合多种自然语言处理(NLP)与机器学习技术来解决该问题。尽管处理葡萄牙语 NLP 可能因资源匮乏而具挑战性,我们的方法在分类任务中表现极为出色,达到了最高准确率 0.93 以及最高平均 F1 分数 0.89(宏平均)与 0.93(加权平均)。此外,我们提取并解释了我们某一模型所学到的模式,并量化了这些模式与分类任务的关联。在机器学习法律应用中,可解释性步骤十分重要,并为我们提供了关于黑盒模型如何决策的引人关注的洞见。
引用
@article{arxiv.2003.11561,
title = {Predicting Legal Proceedings Status: Approaches Based on Sequential Text Data},
author = {Felipe Maia Polo and Itamar Ciochetti and Emerson Bertolo},
journal= {arXiv preprint arXiv:2003.11561},
year = {2021}
}
备注
Published at the 18th International Conference on Artificial Intelligence and Law (ICAIL) 2021 as an extended abstract