生成性数字孪生:面向可执行工业系统的视觉-语言仿真模型
人工智能
2026-01-14 v4 计算与语言
计算机视觉与模式识别
摘要
我们提出了一种视觉-语言仿真模型 (VLSM),该模型统一了视觉与文本理解能力,能够从布局草图和自然语言提示中合成可执行的 FlexScript,从而实现工业仿真系统的跨模态推理。为支撑这一新范式,本研究构建了首个针对生成性数字孪生的大规模数据集,包含超过 120,000 个提示-草图-代码三元组,支持文本描述、空间结构与仿真逻辑之间的多模态学习。同时,本文针对该任务提出了三项新型评估指标:结构有效率 (SVR)、参数匹配率 (PMR) 和执行成功率 (ESR),专门用于全面评估结构完整性、参数保真度及仿真器可执行性。通过对视觉编码器、连接器及代码预训练语言主干的系统化消融实验,所提模型实现了近乎完美的结构准确性和较高的执行鲁棒性。该工作为将视觉推理与语言理解集成到可执行工业仿真系统的生成性数字孪生奠定了基础。项目页面: https://danielhsu2014.github.io/GDT-VLSM-project/
引用
@article{arxiv.2512.20387,
title = {Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems},
author = {YuChe Hsu and AnJui Wang and TsaiChing Ni and YuanFu Yang},
journal= {arXiv preprint arXiv:2512.20387},
year = {2026}
}
备注
10 pages, 9 figures