基于Transformer的自然语言处理方法分析法律法院文书间的相似性
人工智能
2023-05-12 v3 计算与语言
机器学习
摘要
人工智能(AI)的最新进展在解决自然语言处理(NLP)领域的复杂问题中取得了有前景的成果,成为助力法律领域司法程序快速解决的重要工具。在此背景下,本工作针对在推理组中实现司法文书间相似度检测的问题,将六种基于transformer架构的NLP技术应用于巴西司法系统法律程序的案例研究。基于NLP transformer的模型,即BERT、GPT-2和RoBERTa,使用巴西葡萄牙语的通用语料库进行了预训练,随后使用210,000份法律程序针对法律领域进行了微调与专门化。基于各法律文书的嵌入计算其向量表示,用于诉讼案件的聚类,并根据组内元素到其质心的距离余弦计算各模型的质量。我们注意到,基于transformer的模型相较于先前的传统NLP技术表现出更优性能,其中针对巴西葡萄牙语专门化的RoBERTa模型取得了最佳结果。该方法也可应用于其他语言的不同案例研究,从而推动NLP应用于法律领域的当前最先进水平。
引用
@article{arxiv.2204.07182,
title = {Analysing similarities between legal court documents using natural language processing approaches based on Transformers},
author = {Raphael Souza de Oliveira and Erick Giovani Sperandio Nascimento},
journal= {arXiv preprint arXiv:2204.07182},
year = {2023}
}