中文

仅靠自我验证即可通过日本司法考试

计算与语言 2026-01-07 v1 人工智能

摘要

尽管大型语言模型 (LLM) 在过去几年中取得了快速进展,但在高度专业化和结构化的考试中实现可靠性能仍是一个显著挑战。日本司法考试尤其苛刻,要求不仅进行高级法律推理,还需严格遵循复杂的答案格式,涉及对多个命题的联合评估。虽然最近的研究报告了通过将此类问题分解为更简单的真假判断来取得改进,但这些方法在原始考试格式和评分方案下进行系统评估不充分,仍存疑问是否真正捕捉到了考试水平的能力。本文提出一种基于新构建的数据集训练的自我验证模型,该数据集忠实再现了考试的原始格式和评估尺度。我们的模型在实际考试尺度下超越了官方的通过分数,这是已知的首次演示,LLM 在不改变其原始问题结构或评分规则的情况下通过了日本司法考试。我们进一步对包括多智能体推理和分解-基于监督等备选策略进行了大规模比较,发现这些方法未能实现相当的性能。我们的结果凸显了格式忠实监督和一致性验证的重要性,表明仔细设计的单一模型方法在高风险专业推理任务中可以超越更复杂的系统。我们的数据集和代码已公开提供。

关键词

引用

@article{arxiv.2601.03144,
  title  = {Self-Verification is All You Need To Pass The Japanese Bar Examination},
  author = {Andrew Shin},
  journal= {arXiv preprint arXiv:2601.03144},
  year   = {2026}
}

备注

https://github.com/shinandrew/self_verification