LLM 辅助形式化实现内部税法条文一致性的确定性检测
摘要
本研究引入一种混合神经符号框架,实现对复杂法律中条文一致性的确定性检测。我们以美国国内税法 (Internal Revenue Code, IRC) 作为案例研究,因为其复杂性使其成为识别冲突的肥沃领域。我们的研究提供了一种通过结合大语言模型 (Large Language Models, LLMs) 与符号逻辑来检测不一致条款的解决方案。虽然 LLM 方法可支持合规、公平和立法,但税务领域的应用仍较稀少。一个关键挑战是,这类模型在处理层次结构和深层结构推理方面困难,尤其是处理长文本。为此,本研究通过使用 GPT-4o、GPT-5 和 Prolog 进行实验来弥补这些差距。首先使用 GPT-4o 将第 121 节翻译为 Prolog 规则并在 SWISH 中优化。随后,这些规则被纳入提示词,以测试 Prolog 增强式提示是否提高了 GPT-4o 的不一致性检测能力。无论是仅用自然语言提示还是搭配 Prolog 增强提示,GPT-4o 均仅检测到三分之一策略中的不一致情况(33% 准确率),但其推理质量不同:自然语言提示实现了 100% 规则覆盖率,而 Prolog 增强提示实现了 66%,表明更不完整的立法分析。与概率性提示相比,混合 Prolog 模型产生确定性且可重复的结果。基于 GPT-5 的优化,模型成功地形式化了 IRC 条款的相互矛盾解释,并成功检测到了不一致区域。验证测试确认,Prolog 实现是准确的、内部一致的、确定性的,并且能够自主识别不一致情况。这些发现表明,LLM 辅助形式化以符号逻辑为锚,实现了透明且可靠的立法不一致性检测。
引用
@article{arxiv.2511.11954,
title = {LLM-Assisted Formalization Enables Deterministic Detection of Statutory Inconsistency in the Internal Revenue Code},
author = {Borchuluun Yadamsuren and Steven Keith Platt and Miguel Diaz},
journal= {arXiv preprint arXiv:2511.11954},
year = {2025}
}
备注
29 pages, 3 appendices with Prolog code and full codebase available at: https://github.com/borchuluun/section121-inconsistency-detection