中文

PDEAgent-Bench:面向 PDE 求解器生成的多指标多库基准测试

人工智能 2026-05-12 v1

摘要

PDE 到求解器代码生成旨在从偏微分方程 (PDE) 规格中自动合成可执行的数值求解器。此任务不仅需要理解 PDE 的数学结构,还需要选择合适的离散化方案和求解器配置,并在有限元方法 (FEM) 库中正确实现由此产生的公式。现有的代码生成基准主要评估语法正确性或在预定义测试用例上的成功率。据我们所知,目前尚无专门针对 PDE 到求解器代码生成的公开可用基准,且通用代码基准无法完全捕捉数值 PDE 求解的独特挑战,例如确保求解器的准确性、效率以及与专业 FEM 库的兼容性。我们引入了 PDEAgent-Bench,据我们所知,这是首个面向 PDE 到求解器代码生成的多指标、多库基准。PDEAgent-Bench 包含跨越 6 个数学类别和 11 个 PDE 族的 645 个实例,支持 DOLFINx、Firedrake 和 deal.II 等常用 FEM 库。每个实例提供一个面向智能体的问题规格、在规定评估网格上的参考解,以及特定案例的准确性和运行时间目标。PDEAgent-Bench 采用分阶段评估框架,生成的求解器必须依次通过可执行性、数值准确性和计算效率检查。使用代表性 LLM 和代码智能体的实验表明,模型通常能生成可运行代码,但一旦施加准确性和效率要求,通过率便大幅下降。这些结果表明,当前智能体在生成数值可靠且高效的 PDE 求解器方面仍受限,而 PDEAgent-Bench 提供了一个基于数值 PDE 求解实际需求且可复现的测试平台。

关键词

引用

@article{arxiv.2605.09636,
  title  = {PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation},
  author = {Zhen Hang and Yushan Yashengjiang and Junhui Li and Huanshuo Dong and Yang Wei and Zhezheng Hao and Jiangtao Ma and Songlin Bai and Haozhong Kai and Xihang Yue and Gangzong Si and Dongming Jiang and Chao Yao and Zhanhua Hu and Jiangqing Zhang and Pengwei Liu and Yaomin Shen and Xingyu Ren and Lei Liu and Zikang Xu and Han Li and Qingsong Yao and Hande Dong and Hong Wang},
  journal= {arXiv preprint arXiv:2605.09636},
  year   = {2026}
}