CNN在法律文档审查中特权文档检测的应用
信息检索
2021-02-10 v1
摘要
保护特权通信和数据免遭披露对法律团队至关重要。法律建议,如律师-客户通信或诉讼策略,通常在诉讼或监管事件中免于披露,并对律师-客户关系至关重要。为保护此类信息免遭披露,公司和外部法律顾问常审查大量文档以确定含特权材料的文档。该过程极其昂贵且耗时。随着数据量增长,法律顾问通常采用方法减少需审查文档数量,同时平衡确保特权信息保护的需求。关键词搜索被用作定位特权信息并缩减文档审查规模的方法。关键词搜索能有效广撒网,但常返回过度包容的结果——其中大多不含特权信息。为克服关键词搜索的弱点,法律团队日益使用机器学习技术定位特权信息。在这些研究中,经典文本分类技术被用于构建识别特权文档的分类模型。本文中,作者提出一种不同方法,应用机器学习/卷积神经网络技术(CNN)识别特权文档。我们提出的方法将关键词搜索与CNN结合。对每个关键词项,利用该关键词出现处的上下文创建CNN模型。此外,提出一种方法从已标注的正向训练文档中选取可靠的特权(正类)训练关键词出现样本。我们进行了大量实验,结果表明所提方法在仍捕获大多数真正例的同时可显著减少假正例。
引用
@article{arxiv.2102.04845,
title = {CNN Application in Detection of Privileged Documents in Legal Document Review},
author = {Rishi Chhatwal and Robert Keeling and Peter Gronvall and Nathaniel Huber-Fliflet and Jianping Zhang and Haozhen Zhao},
journal= {arXiv preprint arXiv:2102.04845},
year = {2021}
}
备注
2020 IEEE International Conference on Big Data (Big Data)