中文

Ishigaki-IDS-Bench:用于从BIM信息需求生成信息交付规范的基准

计算与语言 2026-05-22 v1

摘要

大型语言模型(LLM)广泛用于生成如 JSON、SQL 和代码等结构化输出,但用于评估必须同时满足行业标准 XML 和领域词汇约束的生成能力的公共资源仍有限。本文提出了 Ishigaki-IDS-Bench,这是一个用于评估从建筑信息模型(BIM)信息需求生成信息交付规范(IDS)XML能力的基准。该基准包含 166 个由 BIM/IDS 专家编写并验证的示例,通过将 83 个实际场景扩展为日文和英文,对应金标准 IDS 文件,以及用于输入格式、语言、轮次设置、IFC 版本和施工领域的元数据。其评估结合基于 IDSAuditTool 的可处理性、结构和内容审计,以及针对金标准 IDS 文件的内容一致性评估。在对 10 个 LLM进行零样本评估时,最佳模型达到 65.6% 的宏平均 F1 分数,而仅有 27.7% 的输出通过内容审计。这些结果表明,当前的 LLM 能够将部分信息需求表达为 IDS,但仍在稳定生成满足 IDS 标准和 IFC 词汇约束的 XML方面存在挑战。Ishigaki-IDS-Bench 支持比较评估、故障分析以及符合领域标准的受约束结构化生成方法的开发。我们在 GitHub 和 Hugging Face 上以 CC BY 4.0 许可证发布评估脚本和基准数据。

关键词

引用

@article{arxiv.2605.22079,
  title  = {Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements},
  author = {Ryo Kanazawa and Koyo Hidaka and Teppei Miyamoto and Takayuki Kato and Tomoki Ando and Chenguang Wang and Dayuan Jiang and Naofumi Fujita and Shuhei Saitoh and Atomu Kondo and Koki Arakawa and Daiho Nishioka},
  journal= {arXiv preprint arXiv:2605.22079},
  year   = {2026}
}

备注

7 pages; benchmark data and evaluation scripts are available on GitHub and Hugging Face