使用短随机块对长律法文件进行分类
计算与语言
2026-01-01 v1 人工智能
摘要
对律法文件进行分类具有挑战性,除了它们具有专业词汇外,文件有时也很长。这意味着将完整文件输入到基于Transformer的模型进行分类可能是不可能的、代价高昂或速度慢的。因此,我们提出了一种基于DeBERTa V3和LSTM的律法文件分类器,其输入为48个随机选取的短块(最大128个标记)。此外,我们展示了其部署管道使用Temporal(一种持久化执行解决方案),以便我们拥有可靠且稳健的处理工作流程。最佳模型的加权F分数为0.898,而在CPU上运行的管道对每100个文件的中位数处理时间为498秒。
关键词
引用
@article{arxiv.2512.24997,
title = {Classifying long legal documents using short random chunks},
author = {Luis Adrián Cabrera-Diego},
journal= {arXiv preprint arXiv:2512.24997},
year = {2026}
}