中文

EpiCurveBench:评估 VLMs 在流行曲线数字化中的能力

计算与语言 2026-05-27 v1

摘要

视觉语言模型(VLM)的图表转数据提取功能正被广泛评估,但现有基准显示存在瓶颈(前沿VLM在ChartQA上超过89%),且评估指标将提取点视为无序的键值对,忽略了时间序列的时序结构,并对微小的对齐偏移进行严厉惩罚。为解决这两个问题,我们提出EpiCurveBench——一个来自多样公共卫生来源精选的1000份真实流行曲线图像基准,以及EpiCurveSimilarity(ECS)评估指标,通过动态规划对预测值和真实值序列进行对齐,容忍局部时序偏移和缺失,同时按比例惩罚。我们评估了六种方法——三种前沿封闭式VLM、一种开放式VLM和两种专业图表提取系统,发现最强模型仅达到52.3%的ECS得分,而ECS将四个通用VLM在25分的得分范围内分布,其中基于键值对的评估指标(RMS、SCRM)将其压缩到5分的区间。我们进一步验证了ECS与四个下游流行病学摘要统计量的关联性,发现更高的ECS预测了在总数、峰值时机、峰值幅值和增长率忠实性方面的更小误差;在所有四个指标中,ECS与动态时间变形(DTW)的相关性高出1.5--3.6倍,后者缺乏缺口惩罚,无法区分被截断的预测与时序忠实的预测。EpiCurveBench旨在解决高影响力的公共卫生应用——释放被出版图表中囚禁数十年的疫情数据——但该基准和指标可直接应用于任何结构化时间序列图表提取场景。

关键词

引用

@article{arxiv.2605.27195,
  title  = {EpiCurveBench: Evaluating VLMs on Epidemic Curve Digitization},
  author = {Thomas Berkane and Maimuna S. Majumder},
  journal= {arXiv preprint arXiv:2605.27195},
  year   = {2026}
}