工程推理与指令(ERI)基准测试:面向基础模型和代理的大型分类学驱动数据集
人工智能
2026-03-04 v1 软件工程
摘要
工程推理与指令(ERI)基准测试是一个由分类学驱动的指令数据集,旨在训练和评估具备工程能力的大型语言模型(LLM)和代理。这一数据集涵盖九个工程领域(即:土木、机械、电气、化学、环境、航空航天、材料、消防和工业工程)和 55 个子领域,并与七种意图类型(即:定义、解释、计算、比较、设计/综合、故障排查和代码相关)以及三个难度层次(即:本科、研究生和专业)交叉,产生 57,750 条记录,包含领域/子领域/类型/难度元数据和解决方案格式。我们通过七个 LLM 检查了 ERI,并报告了三层次的统计显著性能结构,其中领先模型(GPT-5、Claude Sonnet 4、DeepSeek V3.1)在五分制评分中得分均超过 4.30,而中等水平和较小模型表现逐渐恶化,尤其在研究生层次问题上更为明显。为解决 LLM 基准测试中固有的循环性问题,我们开发了一种收敛验证协议,该协议利用跨提供商的独立性、多评委平均值以及领先模型一致性分析,实证将幻觉风险限制在 1.7%。ERI 以分类学规范、验证脚本和评估工具包的形式发布,以支持可重复的比较和回归测试,用于工程场景中的指令调优、路由、检索增强评估和代理式工具使用工作流程。
引用
@article{arxiv.2603.02239,
title = {Engineering Reasoning and Instruction (ERI) Benchmark: A Large Taxonomy-driven Dataset for Foundation Models and Agents},
author = {MZ Naser and Ahmad Bani Awwad and Zoie McCreery and Radwa Eissa and Ahmad Naser and Gianluca Cusatis and Andrew Metcalf and Kapil Madathil and Jamal Abdalla and Venkatesh Kodur and Mohammad Reza Saeb},
journal= {arXiv preprint arXiv:2603.02239},
year = {2026}
}