面向特权审阅的迁移学习实证研究
信息检索
2021-12-17 v1
摘要
在美国法律实务中,保护特权通信与数据免遭无意披露是一项首要任务。传统上律师依赖关键词检索与人工审阅来识别案件中的特权文件。随着数据量增长,这种方式在成本上越来越难以立足。机器学习方法已被用于识别特权文件。鉴于法律案件中特权的可泛化性质,我们假设迁移学习可利用从已有标注数据中学到的知识来识别特权文件,而无需标注新的训练数据。本文中,我们研究了基于BERT的传统机器学习模型与深度学习模型在法律文档审阅中的特权文件分类任务,并在三个带特权标签的真实世界数据集上检验了特权模型中迁移学习的有效性。结果表明BERT模型优于行业标准的逻辑回归算法,且迁移学习模型在同域或相近域的数据集上可取得尚可的性能。
引用
@article{arxiv.2112.08606,
title = {An Empirical Study on Transfer Learning for Privilege Review},
author = {Haozhen Zhao and Shi Ye and Jingchao Yang},
journal= {arXiv preprint arXiv:2112.08606},
year = {2021}
}
备注
2021 IEEE International Conference on Big Data (Big Data)