PlotChain:面向工程图阅读的多模态 LLM 确定性检查点评估
人工智能
2026-04-23 v1 软件工程
摘要
我们提出 PlotChain,这是一个用于评估多模态大语言模型(MLLM)在工程图阅读任务上的基准测试,旨在从经典图表(如 Bode/FFT、阶跃响应、应力-应变、泵曲线)中恢复定量值,而非仅进行 OCR 提取或自由形式描述。PlotChain 包含 15 类图表 family,共 450 张渲染图表(每类 30 张),其中每项均由已知参数生成,并配有直接来自生成过程计算得出的精确 ground truth。核心贡献之一是基于检查点的诊断评估:除最终目标外,每个项目还包含用于隔离子技能(如读取截止频率或峰值幅值)的中间 'cp_' 字段,从而在图表 family 内实现故障定位。我们在标准化、确定性的评估协议下(temperature=0,严格的 JSON-only 数值输出 schema)评估了四个最新 MLLM,并使用旨在反映人类图表阅读精度的 per-field 容差对预测进行评分。在 'plotread' 容差策略下,领先模型在整体字段通过率方面分别取得 80.42%(Gemini 2.5 Pro)、79.84%(GPT-4.1) 和 78.21%(Claude Sonnet 4.5),而 GPT-4o 仅为 61.59%。尽管在许多 family 中表现良好,但频率域任务仍显脆弱:带通响应保持在低于 23%,FFT 频谱仍具有挑战性。我们发布生成器、数据集、原始模型输出、评分代码和带校验和的清单,以支持完全可重复的运行和在备用容差政策下进行的追溯性重新评分。
引用
@article{arxiv.2602.13232,
title = {PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading},
author = {Mayank Ravishankara},
journal= {arXiv preprint arXiv:2602.13232},
year = {2026}
}