RoLegalGEC:面向罗马尼亚语的法律领域语法错误检测与纠正数据集
计算与语言
2026-04-23 v2 人工智能
机器学习
摘要
法律文件中清晰正确文本的重要性不容小觑,因此,旨在协助法律专业人士的语法错误纠正工具必须具备在法律环境语境下理解潜在错误并据此进行纠正的能力,且隐含地需要使用真实的法律数据在同一环境中进行训练。然而,对于罗马尼亚语等语言而言,此类过程所需的人工标注数据十分匮乏,更不用说针对细分领域了。最常见的方法是合成生成平行数据;然而,这需要对罗马尼亚语语法有结构化的理解。据我们所知,在本文中我们引入了首个面向法律领域语法错误检测与纠正的罗马尼亚语平行数据集 RoLegalGEC,该数据集汇集了 350,000 个法律段落中的错误示例及错误标注。此外,我们评估了多个神经网络模型,将这些模型转化为用于检测和纠正语法错误的有价值工具,包括知识蒸馏 Transformer、用于检测的序列标注架构,以及多种用于纠正的预训练 text-to-text Transformer 模型。我们认为,这组模型连同新颖的 RoLegalGEC 数据集,将丰富罗马尼亚语的资源库,以供进一步研究之用。
引用
@article{arxiv.2604.19593,
title = {RoLegalGEC: Legal Domain Grammatical Error Detection and Correction Dataset for Romanian},
author = {Mircea Timpuriu and Mihaela-Claudia Cercel and Dumitru-Clementin Cercel},
journal= {arXiv preprint arXiv:2604.19593},
year = {2026}
}