中文

AI 能否很好地构建系统动态模型?

人工智能 2025-03-21 v1

摘要

导言:随着系统动态(SD) embracing automation,AI提供了效率,但可能因数据缺失和模型不完整而引入偏见。哪怕由人类或AI辅助构建的模型,若忽视多角度和数据,都可能影响模型质量。为减少关于AI构建SD模型能力的不确定性,我们引入两个指标来评估AI生成的因果图:技术正确性(因果翻译)和指令遵循性(conformance)。方法:我们开发了一个开源项目sd-ai,旨在为SD社区提供合作基础,充分发挥如ChatGPT等AI工具的潜力。此外,我们构建了评估理论,并设计了一套全面的测试套件,用于评估sd-ai生态系统内开发的任何工具。结果:我们测试了11个不同的大语言模型,其在因果翻译和指令遵循方面的能力。gpt-4.5-preview表现最佳,总体得分为92.9%,在两个任务中均表现出色。o1在因果翻译方面得分100%。gpt-4o识别了所有因果链接,但在降低术语的正极性方面表现不足。虽然gpt-4.5-preview和o1最为准确,但gpt-4o成本最低。讨论:应用于sd-ai引擎的因果翻译和遵循测试揭示了不同大语言模型之间存在显著差异,凸显了持续评估以确保AI工具在动态建模领域负责任发展的必要性。为此,已启动由工具开发者、模型员和利益相关者发起的合作,旨在标准化评估AI工具提升建模过程能力的措施。

关键词

引用

@article{arxiv.2503.15580,
  title  = {How Well Can AI Build SD Models?},
  author = {William Schoenberg and Davidson Girard and Saras Chung and Ellen O'Neill and Janet Velasquez and Sara Metcalf},
  journal= {arXiv preprint arXiv:2503.15580},
  year   = {2025}
}