法律文档审查中主动学习策略的实证评估
信息检索
2019-04-04 v1
摘要
一种机器学习类型——文本分类,如今已定期应用于涉及海量文档群体的法律事务中,因为它能够减少与这些文档审查相关的时间和费用。一种机器学习形式——主动学习(Active Learning)——引起了法律界的关注,因为它有潜力使机器学习过程更加有效。应用于法律文档的主动学习在法律领域被视为一项新技术,并且会持续应用于法律事务中的所有文档,直到剩余待审查的相关文档数量可忽略不计。这种实现方式与传统主动学习的实现略有不同,后者在达到可接受的模型性能后便停止过程。本文的目的有二:(i)质疑主动学习是否确实是一种更优的学习方法;(ii)强调主动学习可最有效地应用于真实法律行业数据的方式。与其他研究不同,我们的实验是针对取自近期涵盖多个领域的真实世界法律事务的大型数据集进行的。我们得出结论:尽管这些实验表明法律文档审查中广泛使用的主动学习策略能够快速识别信息丰富的训练文档,但其随时间推移效果变差。具体而言,我们的发现表明,法律领域这种最流行的主动学习形式(即选择得分最高的文档作为训练样本)在大多数情况下实际上并非最高效的方法。最终,不同的主动学习策略可能最适合启动预测建模过程,但不适合贯穿整个文档审查。
引用
@article{arxiv.1904.01719,
title = {Empirical Evaluations of Active Learning Strategies in Legal Document Review},
author = {Rishi Chhatwal and Nathaniel Huber-Fliflet and Robert Keeling and Jianping Zhang and Haozhen Zhao},
journal= {arXiv preprint arXiv:1904.01719},
year = {2019}
}
备注
2017 IEEE International Conference on Big Data (Big Data)