面向智能法律文档分析:基于 CNN 的案例法文本分类
计算与语言
2026-04-21 v1 人工智能
摘要
法律实践者和司法机构面临着日益增长的案例法文档数量,这些文档以形式化语言、冗长的句子结构和高度专业的术语为特征,使得手动分类既耗时又容易出错。本文提出一种轻量且高精度的分类框架,用于引用处理分类,该框架将形态学预处理与子词感知的 FastText 嵌入相结合,并采用多核一维卷积神经网络(CNN)。在 25,000 份带标注的公开法律文档语料库上进行评估,采用 75/25 的训练-测试划分,本文提出的系统实现了 97.26% 的分类准确率和 96.82% 的宏平均 F1 分数,超越了包括在内的各种基线模型,如微调的 BERT、带 FastText 的长短期记忆网络(LSTM)、使用随机嵌入的 CNN 以及基于词频-逆文档频率(TF-IDF)的 K 近邻分类器。该模型还在所有比较系统中实现了最高的受控器操作特征曲线下面积(AUC-ROC)为 97.83%,同时仅使用 510 万参数,推理延迟仅为每份文档 0.31 毫秒——比 BERT 慢至少 13 倍。消融实验确认了每个管道组件的独立贡献,混淆矩阵显示残余错误仅限于语义相邻的引用类别。这些发现表明,精心设计的卷积网络代表了一种可扩展且资源高效的替代方案,用于智能法律文档分析。
引用
@article{arxiv.2604.17674,
title = {Towards Intelligent Legal Document Analysis: CNN-Driven Classification of Case Law Texts},
author = {Moinul Hossain and Sourav Rabi Das and Zikrul Shariar Ayon and Sadia Afrin Promi and Ahnaf Atef Choudhury and Shakila Rahman and Jia Uddin},
journal= {arXiv preprint arXiv:2604.17674},
year = {2026}
}