中文

面向法律关键软件的 LLM 智能体方法:税务准备软件案例研究

软件工程 2026-03-05 v2 人工智能

摘要

大型语言模型 (LLM) 在将自然语言法规翻译为可执行逻辑方面显示出前景,但在法律关键场景中仍面临因模糊性和幻觉导致的可靠性挑战。我们提出一种用于开发法律关键软件的智能体方法,选用美国联邦税务准备作为案例研究。核心挑战在于在 Oracle 问题下进行测试用例生成,该问题要求正确输出依赖于法律解释。基于变形测试 (metamorphic testing),我们引入更高阶变形关系,通过对类似个体之间的结构性偏移进行比较来评估系统输出。由于编写此类关系繁琐且易出错,我们使用 LLM 驱动的、基于角色的框架自动化测试生成与代码合成。我们实现了一个多智能体系统,用于将税务法规翻译为可执行软件,并集成一个变形测试智能体以搜索反例。在实验中,我们的框架使用较小的模型 (GPT-4o-mini) 在复杂税务代码任务上实现了最坏情况的通过率为 45%,显著优于前沿模型 (GPT-4o 与 Claude 3.5,分别为 9-15%)。这些结果支持智能体 LLM 方法论作为从自然语言规格开发可靠、值得信赖的法律关键软件的路径。

关键词

引用

@article{arxiv.2509.13471,
  title  = {An LLM Agentic Approach for Legal-Critical Software: A Case Study for Tax Prep Software},
  author = {Sina Gogani-Khiabani and Ashutosh Trivedi and Diptikalyan Saha and Saeid Tizpaz-Niari},
  journal= {arXiv preprint arXiv:2509.13471},
  year   = {2026}
}

备注

To appear at ICSE 26. 12 pages