中文

MultiLegalSBD:一个多语言法律句子边界检测数据集

计算与语言 2023-05-03 v1 人工智能 机器学习

摘要

句子边界检测(SBD)是自然语言处理(NLP)的基础构建模块之一,错误切分的句子会严重影响下游任务的输出质量。对于算法而言,这是一项具有挑战性的任务,尤其在法律领域,考虑到其所使用的复杂且各异的句子结构。在本文中,我们整理了一个多样化的多语言法律数据集,包含 6 种语言中超过 130'000 条标注句子。我们的实验结果表明,现有 SBD 模型在多语言法律数据上的表现欠佳。我们基于 CRF、BiLSTM-CRF 和 transformers 训练并测试了单语言与多语言模型,展示了最先进的性能。我们还表明,在葡萄牙语测试集的零样本设定下,我们的多语言模型优于所有基线。为鼓励社区进一步的研发,我们已公开我们的数据集、模型与代码。

关键词

引用

@article{arxiv.2305.01211,
  title  = {MultiLegalSBD: A Multilingual Legal Sentence Boundary Detection Dataset},
  author = {Tobias Brugger and Matthias Stürmer and Joel Niklaus},
  journal= {arXiv preprint arXiv:2305.01211},
  year   = {2023}
}

备注

Accepted at ICAIL 2023