中文

从垫子上提示:大规模预训练不足以准备 LLM 进行普通意义分析

计算与语言 2026-05-15 v3

摘要

在美国司法体系中,法律解释的广泛方法是评估法律文本将被何方听者理解. 最近的学术工作提出,法律实践者应利用大语言模型(LLM)来确定文本的普通意义. 但这些模型是否具备完成这一任务的能力?随着文本解释问题在从刑法到公民权利等领域中不断出现,我们认为在模型被当作权威之前,必须进行严格的评估. 本工作提供了对 LLM 辅助解释作为最近实践的经验性论证,由此最近的学者和联邦法官推理:模型在训练中看到的大量数据能够使模型阐明人们平常如何使用某些词语或短语. 在受控实验中,我们发现鲁棒性失效,这动摇了这一假设,并对这些模型在实际中的实用性提出严重质疑. 对于我们评估中的模型,问题格式的微小变化会导致截然不同的结论——这一漏洞可能被有利于特定结果的各方利用. 与由相似法律解释问题的数据集进行比较,我们看到这些模型至少在人类判断上仅能实现中等相关性——这在该领域风险较大的应用中并不足够.

关键词

引用

@article{arxiv.2510.25356,
  title  = {Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis},
  author = {Abhishek Purushothama and Junghyun Min and Brandon Waldon and Nathan Schneider},
  journal= {arXiv preprint arXiv:2510.25356},
  year   = {2026}
}

备注

Accepted FAccT 2026; 29 pages, 14 tables, 7 figures. Previous title - Not ready for the bench: LLM legal interpretation is unstable and out of step with human judgments; NLLPW 2026