基线的惊人有效性:关于法律文本分类中 SVM 的讨论
计算与语言
2021-10-25 v2
摘要
我们旨在凸显一个有趣的趋势,以期为围绕法律自然语言处理进展的持续讨论做出贡献。近来,大多数法律文本分类任务的焦点已转向 BERT 等大型预训练深度学习模型。在本文中,我们展示了基于支持向量机(Support Vector Machine, SVM)分类器的更传统方法在 LexGLUE 基准的分类任务上达到了与基于 BERT 的模型令人惊讶的竞争性性能。我们还强调,在法律领域中,使用专门的基于 BERT 的模型相对于基线所获得的错误率降低,相较于通用语言任务明显更小。我们提出并讨论了三个假设作为对这些结果的潜在解释,以支持未来的讨论。
引用
@article{arxiv.2109.07234,
title = {The Unreasonable Effectiveness of the Baseline: Discussing SVMs in Legal Text Classification},
author = {Benjamin Clavié and Marc Alphonsus},
journal= {arXiv preprint arXiv:2109.07234},
year = {2021}
}
备注
6 pages, to be presented at JURIX 2021