中文

CNN 与其他学习算法在法律文档审查文本分类中的实证比较

信息检索 2019-12-23 v1 机器学习

摘要

研究表明,卷积神经网络(CNN)可作为预测编码协议的一部分有效应用于文本分类。尽管如此,迄今为止大多数研究是在短文档数据集上进行的,未能反映真实世界文档审查中文档的多样性。利用来自四次实际审查、文档长度各异的数据,我们将 CNN 与其他流行的文本分类机器学习算法进行比较,包括逻辑回归、支持向量机和随机森林。对于每个数据集,使用不同学习算法以不同训练样本量训练分类模型。随后使用大型随机采样文档测试集评估这些模型,并使用精确率与召回率曲线比较结果。我们的研究表明 CNN 表现良好,但在数据集与训练样本量的组合中,没有单一算法表现最佳。这些结果将有助于推进法律行业使用最大化性能的机器学习算法的研究。

关键词

引用

@article{arxiv.1912.09499,
  title  = {Empirical Comparisons of CNN with Other Learning Algorithms for Text Classification in Legal Document Review},
  author = {Robert Keeling and Rishi Chhatwal and Nathaniel Huber-Fliflet and Jianping Zhang and Fusheng Wei and Haozhen Zhao and Shi Ye and Han Qin},
  journal= {arXiv preprint arXiv:1912.09499},
  year   = {2019}
}

备注

2019 IEEE International Conference on Big Data (Big Data)