预测编码中种子集选择策略的实证评估
信息检索
2019-03-22 v1 人工智能
摘要
训练文档对法律领域预测模型的性能有显著影响。然而,探讨训练文档选择策略——尤其是用于选择种子集(即律师首先审阅以建立初始模型的一组文档)的策略——有效性的研究十分有限。由于关于预测编码这一重要组件的研究有限,本文作者着手识别始终表现良好的策略。我们的研究表明,种子集选择策略对预测模型的精度有显著影响。让律师借助本研究的结果,将使他们能够启动最有效的预测建模流程,以梳理现代诉讼通常涉及的太字节级数据。本研究使用来自四个真实法律案件的文档来评估八种不同的种子集选择策略。律师可利用本文中的结果来改进其预测编码方法。
引用
@article{arxiv.1903.08816,
title = {Empirical Evaluations of Seed Set Selection Strategies for Predictive Coding},
author = {Christian J. Mahoney and Nathaniel Huber-Fliflet and Katie Jensen and Haozhen Zhao and Robert Neary and Shi Ye},
journal= {arXiv preprint arXiv:1903.08816},
year = {2019}
}
备注
2018 IEEE International Conference on Big Data