中文

基线的惊人有效性:关于法律文本分类中 SVM 的讨论

计算与语言 2021-10-25 v2

摘要

我们旨在凸显一个有趣的趋势,以期为围绕法律自然语言处理进展的持续讨论做出贡献。近来,大多数法律文本分类任务的焦点已转向 BERT 等大型预训练深度学习模型。在本文中,我们展示了基于支持向量机(Support Vector Machine, SVM)分类器的更传统方法在 LexGLUE 基准的分类任务上达到了与基于 BERT 的模型令人惊讶的竞争性性能。我们还强调,在法律领域中,使用专门的基于 BERT 的模型相对于基线所获得的错误率降低,相较于通用语言任务明显更小。我们提出并讨论了三个假设作为对这些结果的潜在解释,以支持未来的讨论。

关键词

引用

@article{arxiv.2109.07234,
  title  = {The Unreasonable Effectiveness of the Baseline: Discussing SVMs in Legal Text Classification},
  author = {Benjamin Clavié and Marc Alphonsus},
  journal= {arXiv preprint arXiv:2109.07234},
  year   = {2021}
}

备注

6 pages, to be presented at JURIX 2021