中文

预测编码中种子集选择方法与主动学习策略的评估

信息检索 2019-06-12 v1 机器学习

摘要

主动学习是文本分类中一种流行的方法——在法律领域被称为“预测编码”、“技术辅助审查”或“TAR”——因其有潜力在构建有效分类器时最小化所需审查工作量。本研究通过大量实验,在预测编码任务中考察了流行的种子集选择策略对主动学习的影响,并针对快速、精确分类大规模文档集的目标,评估了不同主动学习策略与经过深入研究的连续主动学习策略的效果。我们研究了随机采样、关键词模型和基于聚类的种子集选择策略,结合排名靠前、不确定性、随机、召回启发和混合主动学习文档选择策略,如何影响预测编码中主动学习的性能。我们以达到 75% 召回率所需审查的文档百分比作为“基准”指标来评估和比较各种方法。在大多数情况下,我们发现种子集选择方法影响较小,但在低丰富度数据集或选择排名靠前主动学习策略时,它们确实表现出显著影响。我们的结果还表明,采用不确定性、随机或 75% 召回率选择策略的主动学习方法,有潜力比流行的连续主动学习方法(排名靠前选择)更早达到最优主动学习轮次。本研究结果揭示了主动学习种子集选择策略的影响,以及后续学习轮次中选择策略的有效性。法律从业者可以利用本研究结果提高其预测编码流程的效率、精确性和简便性。

关键词

引用

@article{arxiv.1906.04367,
  title  = {Evaluation of Seed Set Selection Approaches and Active Learning Strategies in Predictive Coding},
  author = {Christian J. Mahoney and Nathaniel Huber-Fliflet and Haozhen Zhao and Jianping Zhang and Peter Gronvall and Shi Ye},
  journal= {arXiv preprint arXiv:1906.04367},
  year   = {2019}
}

备注

1st International Workshop on AI and Intelligent Assistance for Legal Professionals in the Digital Workplace (LegalAIIA) at The 17th International Conference on Artificial Intelligence and Law (ICAIL 2019)