中文

SimuScene:用于模拟物理情景的代码生成训练与基准

机器学习 2026-02-12 v1

摘要

大型语言模型 (LLM) 已被广泛用于数学竞赛、复杂编码和科学推理等任务,但其通过代码准确表示和模拟物理情景的能力尚未得到充分探索。我们提出 SimuScene,是首个系统性地训练和评估 LLM 在五个物理学科域和52个物理概念上进行物理情景模拟的研究。我们构建了一个自动化数据收集流程,并通过人工验证确保数据质量。最终数据集包含7659个物理情景,其中334个经人工验证的示例作为测试集。我们评估了10个当代 LLM,发现即使是最强的模型也仅实现了21.5%的通过率,表明该任务具有较大难度。最后,我们引入一个基于视觉奖励的强化学习管道,使用视觉语言模型作为评判器训练文本模型。实验表明,使用我们的数据可提升通过代码进行物理模拟的能力,同时显著增强了通用代码生成性能。

关键词

引用

@article{arxiv.2602.10840,
  title  = {SimuScene: Training and Benchmarking Code Generation to Simulate Physical Scenarios},
  author = {Yanan Wang and Renxi Wang and Yongxin Wang and Xuezhi Liang and Fajri Koto and Timothy Baldwin and Xiaodan Liang and Haonan Li},
  journal= {arXiv preprint arXiv:2602.10840},
  year   = {2026}
}