中文

面向印度法律推理的 LLM 是否法院就绪?

计算机与社会 2025-10-22 v1 人工智能 计算与语言

摘要

大语言模型 (LLM) 正进入法律工作流程,但我们缺乏面向特定司法辖区的框架来评估其基线能力。我们以印度公共法律考试作为透明的代理。我们的多年基准汇集了来自顶尖全国和州级考试的客观题目,并在真实世界的考试条件下评估开放和前沿 LLM。为探究多选题之外的能力,我们还包括了一项由律师评分、盲法的来自最高法院的 Advocacy-on-Record 考试的长篇答案研究。据我们了解,这是首个以考试为基础、印度特定的 LLM 法院就绪标准,随数据集和协议公开发布。我们的工作表明,尽管前沿系统在历史通过率线上始终通过,且常在客观考试中匹配或超过近期顶尖得分段,但没有一项超过人类第一名。评分员注释集中于三个可靠性失效模式:程序或格式合规、权威或引用规范、以及论坃适当的语气和结构。这些发现界定了了 LLM 可协助的领域(检查、跨法规一致性、法规和先例查找),以及人类领导仍不可或缺的领域:论坃特定的起草和提交、程序和救济策略、权威与例外的调和,以及伦理、负责任的判断。

关键词

引用

@article{arxiv.2510.17900,
  title  = {Are LLMs Court-Ready? Evaluating Frontier Models on Indian Legal Reasoning},
  author = {Kush Juvekar and Arghya Bhattacharya and Sai Khadloya and Utkarsh Saxena},
  journal= {arXiv preprint arXiv:2510.17900},
  year   = {2025}
}