中文

葡萄牙语法律语义文本相似度数据集:弱监督与标注过程的对比

计算与语言 2023-06-02 v1 机器学习

摘要

巴西司法系统工作量巨大,导致法律诉讼结案耗时长久。巴西国家司法委员会已在第469/2022号决议中确立了文档与流程数字化的正式指南,为使用自动化技术辅助法律领域的日常任务(尤其是法律程序常规中产生的大量文本)开辟了可能。值得注意的是,人工智能(AI)技术能够处理并从文本数据中提取有用信息,有望加速该流程。然而,多种AI技术所需的法律领域数据集稀缺且难以获取,因为它们需要专家标注。为应对这一挑战,本文贡献了四个法律领域数据集:两个含文档与元数据但无标注,另两个以启发式方法标注,旨在用于文本语义相似度任务。此外,为评估所提启发式标注过程的有效性,本文展示了一个由领域专家标注生成的小型真值数据集。对真值标签的分析凸显,即便对领域专家而言,领域文本的语义分析也可能具有挑战性。同时,真值标签与启发式标签的对比表明启发式标签是有用的。

关键词

引用

@article{arxiv.2306.00007,
  title  = {Datasets for Portuguese Legal Semantic Textual Similarity: Comparing weak supervision and an annotation process approaches},
  author = {Daniel da Silva Junior and Paulo Roberto dos S. Corval and Aline Paes and Daniel de Oliveira},
  journal= {arXiv preprint arXiv:2306.00007},
  year   = {2023}
}