中文

SimBench:用于评估和诊断基于LLM的数字孪生生成的框架

人工智能 2026-01-29 v2

摘要

我们介绍SimBench,一个旨在评估面向模拟器的大语言模型(S-LLM)生成可用于仿真器中虚拟测试的数字孪生体(DT)的基准。给定一组S-LLM,本基准根据其生产高质量DT的能力进行排序。我们通过比较超过33个开源和闭源S-LLM来演示这一点。通过多轮交互,SimBench采用一种基于LLM的评判(J-LLM),该评判利用预定义规则和人类在环指导来为由S-LLM生成的DT分配分数,从而提供一致且受专家启发的评估协议。J-LLM是特定于仿真器的,本文在开源Chrono多物理仿真器的框架下演示了所提出的基准方法。Chrono为评估S-LLM在其能力方面创建数字孪生体(包括多体动力学、有限元分析、车辆动力学、机器人动力学和传感器仿真)而提供了背景。该提出的基准原则具有广泛适用性,使能够评估S-LLM在其他仿真软件包(如ANSYS、ABAQUS、OpenFOAM、StarCCM+、IsaacSim和pyBullet)中生成数字孪生体的能力。

关键词

引用

@article{arxiv.2408.11987,
  title  = {SimBench: A Framework for Evaluating and Diagnosing LLM-Based Digital-Twin Generation for Multi-Physics Simulation},
  author = {Jingquan Wang and Andrew Negrut and Hongyu Wang and Harry Zhang and Dan Negrut},
  journal= {arXiv preprint arXiv:2408.11987},
  year   = {2026}
}