基于机器学习方法的法律文章行业领域自动检测
计算与语言
2023-03-10 v1 机器学习
摘要
自动识别法律发展类文章(或就此而言任何类型的新闻文章)中所涵盖行业领域的能力,可为读者和内容创作者自身带来诸多益处。通过对文章按行业覆盖进行标注,世界各地的读者将能够获取针对其所在地区和专业行业的法律新闻。同时,作者将受益于了解哪些行业可能缺乏报道,或读者目前最感兴趣的行业有哪些,从而将写作精力集中于更具包容性和相关性的法律新闻报道。本文研究了一种由机器学习驱动的行业分析方法,该方法将自然语言处理(NLP)与统计及机器学习(ML)技术相结合。我们创建了一个包含超过1700篇标注法律文章的数据集,用于识别六个行业领域。我们从文本中提取了基于文本和法律的特性。我们应用了传统ML方法(如梯度提升机算法和基于决策树的算法)以及深度神经网络(如transformer模型)进行预测模型的性能比较。该系统取得了有前景的结果,在六个行业领域上接收者操作特征曲线下面积得分高于0.90,F值高于0.81。实验结果表明,所提出的采用ML技术的自动化行业分析能够以简单、高效且可扩展的方式处理大规模文本数据集合。当研究仅可用小规模且特定领域的训练数据时,传统ML方法优于深度神经网络。
引用
@article{arxiv.2303.05387,
title = {Automatic Detection of Industry Sectors in Legal Articles Using Machine Learning Approaches},
author = {Hui Yang and Stella Hadjiantoni and Yunfei Long and Ruta Petraityte and Berthold Lausen},
journal= {arXiv preprint arXiv:2303.05387},
year = {2023}
}
备注
26 pages, 5 figures, 3 tables. Paper was presented at 'Classification and Data Science in the Digital Age', 17th conference of the International Federation of Classification Societies (IFCS2022), Porto, Portugal, https://ifcs2022.fep.up.pt/