中文

法律文档审查中的可解释文本分类:可解释预测编码案例研究

信息检索 2019-04-04 v1

摘要

在当今的法律环境中,诉讼和监管调查要求公司开展日益密集的以数据为中心的工作,以识别、收集和分析大量数据。当文档被安排进行审查时,该过程可能要求公司投入非凡水平的资源,既涉及人力资源,也涉及使用基于技术的方法来智能筛选数据。多年来,律师一直使用各种工具开展此项工作,而最近,他们正在接受使用文本分类等机器学习技术,以高效筛选海量数据并识别在这些事务中使用的相关文档。近年来,一群AI与机器学习研究人员一直在积极研究可解释AI(Explainable AI)。在可解释AI系统中,行为或决策是人类可理解的。在典型的法律“文档审查”场景中,只要文档中的一个或多个文本片段被视为相关,该文档即可被判定为相关。在这些场景中,如果预测编码可用于定位这些相关片段,那么律师便能轻松评估模型的文档分类决策。当以明确且可解释的结果部署时,预测编码能够通过减少文档审查所需时间,大幅增强文档审查过程的整体质量与速度。本文作者提出可解释预测编码的概念以及简单的可解释预测编码方法,以在相关文档中定位相关片段。我们还报告了使用来自一桩涉及此类文档审查的实际法律事务的数据所得的初步实验结果。

关键词

引用

@article{arxiv.1904.01721,
  title  = {Explainable Text Classification in Legal Document Review A Case Study of Explainable Predictive Coding},
  author = {Rishi Chhatwal and Peter Gronvall and Nathaniel Huber-Fliflet and Robert Keeling and Jianping Zhang and Haozhen Zhao},
  journal= {arXiv preprint arXiv:1904.01721},
  year   = {2019}
}

备注

2018 IEEE International Conference on Big Data