LegalLens:利用 LLM 在非结构化文本中识别法律违规行为
计算与语言
2024-02-08 v1 人工智能
机器学习
摘要
在本研究中,我们聚焦于两个主要任务:第一个任务是在非结构化文本数据中检测法律违规行为,第二个任务是将这些违规行为与潜在受影响的个体相关联。我们使用大型语言模型(LLM)构建了两个数据集,随后由领域专家标注者进行了验证。这两个任务均专门针对集体诉讼案件的背景而设计。实验设计融合了对 BERT 系列模型和开源 LLM 的微调,以及使用闭源 LLM 进行的少样本实验。我们的结果(违规行为识别的 F1-score 为 62.69%,关联受害者的 F1-score 为 81.02%)表明,我们的数据集和设置可用于完成这两项任务。最后,我们公开发布了数据集和用于实验的代码,以推动法律自然语言处理(NLP)领域的进一步研究。
引用
@article{arxiv.2402.04335,
title = {LegalLens: Leveraging LLMs for Legal Violation Identification in Unstructured Text},
author = {Dor Bernsohn and Gil Semo and Yaron Vazana and Gila Hayat and Ben Hagag and Joel Niklaus and Rohit Saha and Kyryl Truskovskyi},
journal= {arXiv preprint arXiv:2402.04335},
year = {2024}
}