中文

SoM-1K:面向材料强度问题的千题基准数据集

计算与语言 2025-09-26 v1

摘要

基础模型在各个领域展现出惊人的能力,但其在复杂多模态工程问题上的表现仍鲜有探索。我们引入SoM-1K,首个大规模多模态基准数据集,专用于评估基础模型在材料强度(Strength of Materials, SoM)问题中的表现。该数据集包含1065个标注好的SoM问题,镜像真实世界工程任务,包括文本问题表述和示意图。由于当前基础模型在理解复杂视觉信息方面能力有限,我们提出了一种新颖的提示策略,即图像描述(Descriptions of Images, DoI),提供由专家生成的严谨文本描述作为上下文。我们评估了八个代表性基础模型,包括大型语言模型(LLM)和视觉语言模型(VLM)。我们的结果显示,当前基础模型在这些工程问题上表现显著受限,最佳模型仅达到56.6%的准确率。有趣的是,我们发现当提供DoI时,LLM往往优于提供视觉图示的VLM。详细的错误分析表明,DoI在缓解视觉误解释方面发挥关键作用,表明准确的文本描述对当前基础模型而言比直接图像输入更有效。本工作为工程AI建立严格的基准,凸显了在科学和工程语境中开发更稳健多模态推理能力的critical需求。

关键词

引用

@article{arxiv.2509.21079,
  title  = {SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials},
  author = {Qixin Wan and Zilong Wang and Jingwen Zhou and Wanting Wang and Ziheng Geng and Jiachen Liu and Ran Cao and Minghui Cheng and Lu Cheng},
  journal= {arXiv preprint arXiv:2509.21079},
  year   = {2025}
}