MultiLegalSBD:一个多语言法律句子边界检测数据集
计算与语言
2023-05-03 v1 人工智能
机器学习
摘要
句子边界检测(SBD)是自然语言处理(NLP)的基础构建模块之一,错误切分的句子会严重影响下游任务的输出质量。对于算法而言,这是一项具有挑战性的任务,尤其在法律领域,考虑到其所使用的复杂且各异的句子结构。在本文中,我们整理了一个多样化的多语言法律数据集,包含 6 种语言中超过 130'000 条标注句子。我们的实验结果表明,现有 SBD 模型在多语言法律数据上的表现欠佳。我们基于 CRF、BiLSTM-CRF 和 transformers 训练并测试了单语言与多语言模型,展示了最先进的性能。我们还表明,在葡萄牙语测试集的零样本设定下,我们的多语言模型优于所有基线。为鼓励社区进一步的研发,我们已公开我们的数据集、模型与代码。
引用
@article{arxiv.2305.01211,
title = {MultiLegalSBD: A Multilingual Legal Sentence Boundary Detection Dataset},
author = {Tobias Brugger and Matthias Stürmer and Joel Niklaus},
journal= {arXiv preprint arXiv:2305.01211},
year = {2023}
}
备注
Accepted at ICAIL 2023