中文

化学表格上多模态大语言模型的识别与理解评估基准

人工智能 2025-12-12 v2 计算与语言

摘要

随着多模态大语言模型在科学智能领域的广泛应用,亟需更具挑战性的评估基准来衡量其理解复杂科学数据的能力。科学表格作为知识表征的核心载体,融合了文本、符号与图形,形成了典型的多模态推理场景。然而,现有基准大多聚焦于通用领域,未能反映科学研究中固有的独特结构复杂性和领域特定语义。化学表格尤为典型:它们将试剂、条件和产率等结构化变量与分子结构和化学式等视觉符号交织在一起,对模型在跨模态对齐和语义解析方面构成了重大挑战。为此,我们提出了 ChemTable——一个从真实文献中构建的大规模化学表格基准,包含专家标注的单元格布局、逻辑结构和领域特定标签。它支持两项核心任务:(1) 表格识别(结构与内容提取);以及 (2) 表格理解(描述性与推理型问答)。在 ChemTable 上的评估表明,尽管主流多模态模型在布局解析方面表现尚可,但在处理分子结构和符号惯例等关键元素时仍面临显著局限。闭源模型整体领先,但仍不及人类水平的表现。本工作为评估科学多模态理解提供了一个真实的测试平台,揭示了领域特定推理的当前瓶颈,并推动了科学研究智能系统的发展。

关键词

引用

@article{arxiv.2506.11375,
  title  = {Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables},
  author = {Yitong Zhou and Mingyue Cheng and Qingyang Mao and Yucong Luo and Qi Liu and Yupeng Li and Xiaohan Zhang and Deguang Liu and Xin Li and Enhong Chen},
  journal= {arXiv preprint arXiv:2506.11375},
  year   = {2025}
}