面向印度法律数据的结构化定义与分段: 法律推理中的LLM研究
计算与语言
2025-11-27 v1 人工智能
摘要
大型语言模型(LLM)在网络数据上进行训练,展现出惊人的通用推理能力。尽管如此,它们在专业领域如法律方面仍常感到困惑,主要是因为缺乏领域特定的预训练。法律领域具有独特挑战,因为法律文件通常较长且复杂,使模型难以高效处理完整文本。以往研究探索了以情境方式应对知识差距的方法,在无完全领域对齐的情况下提升模型在新领域的性能。在本文中,我们通过三个实验区域分析模型在法律任务上的行为:(i)根据修辞角色重新组织文档,以评估结构化信息对长上下文处理和模型决策的影响;(ii)定义修辞角色以熟悉模型法律术语;(iii)模拟法院对修辞角色的逐步推理,以增强模型推理。这些实验在零-shot设置下进行,涵盖三个印度法律判决预测数据集。我们的结果表明,组织数据或解释关键法律术语显著提升了模型性能,相较于基线最低提升约1.5%,最高提升4.36%的F1分数。
引用
@article{arxiv.2511.20669,
title = {Structured Definitions and Segmentations for Legal Reasoning in LLMs: A Study on Indian Legal Data},
author = {Mann Khatri and Mirza Yusuf and Rajiv Ratn Shah and Ponnurangam Kumaraguru},
journal= {arXiv preprint arXiv:2511.20669},
year = {2025}
}
备注
Accepted at BDA 2025 as short paper; This paper is long version