法律领域中的数据中心机器学习
机器学习
2022-01-19 v1 人工智能
计算与语言
摘要
机器学习研究通常以早期创建的固定数据集为起点。实验的重点是寻找能在所选评估指标上取得最佳表现的模型与训练流程。本文探讨数据集的变化如何影响模型的实测表现。利用来自法律领域的三个公开数据集,我们研究了数据规模、训练/测试划分以及人工标注准确率的变化如何影响所训练深度学习分类器的表现。我们评估了整体表现(加权平均)以及各类别表现。观察到的效应出乎意料地明显,尤其在考虑各类别表现时。我们探究了类的“语义同质性”(即句子在语义嵌入空间中的邻近度)如何影响其分类难度。所呈现的结果对 AI 与法律领域的数据收集与整理工作具有深远影响。结果还表明,改进数据集可被视为除推进 ML 模型之外、提升 AI 与法律各类任务分类表现的又一途径。最后,我们讨论了建立评估数据集属性潜在效应方法学的必要性。
引用
@article{arxiv.2201.06653,
title = {Data-Centric Machine Learning in the Legal Domain},
author = {Hannes Westermann and Jaromir Savelka and Vern R. Walker and Kevin D. Ashley and Karim Benyekhlef},
journal= {arXiv preprint arXiv:2201.06653},
year = {2022}
}