中文

法律文本的无监督简化

计算与语言 2022-09-02 v1 人工智能 机器学习

摘要

法律文本的处理已成为自然语言处理(NLP)中一个新兴领域。法律文本在词汇、语义、句法和形态上包含独特的行话和复杂的语言属性。因此,开发针对法律领域的文本简化(TS)方法对于促进普通人理解法律文本以及为高层模型提供主流法律NLP应用输入至关重要。尽管近期一项研究提出了一种基于规则的法律文本TS方法,但基于学习的法律领域TS此前未被考虑。本文我们引入一种法律文本无监督简化方法(USLT)。USLT通过替换复杂词和拆分长句来执行领域特定的TS。为此,USLT检测句子中的复杂词,通过掩码Transformer模型生成候选词,并基于排序分数选择替换候选。之后,USLT在保留语义的前提下将长句递归分解为较短核心句和上下文句的层次结构。我们证明USLT在文本简洁性上优于最先进的领域通用TS方法,同时保持语义不变。

关键词

引用

@article{arxiv.2209.00557,
  title  = {Unsupervised Simplification of Legal Texts},
  author = {Mert Cemri and Tolga Çukur and Aykut Koç},
  journal= {arXiv preprint arXiv:2209.00557},
  year   = {2022}
}