中文

MatViX:从视觉富文本文章中提取多模态信息

计算与语言 2024-10-29 v1

摘要

多模态信息提取(MIE)对科学文献至关重要,因为有价值的数据通常散布在文本、图表和表格中。在材料科学领域,从研究文章中提取结构化信息可以加速新材料的发现。然而,科学内容的多模态特性和复杂的相互联系给传统的基于文本的方法带来了挑战。我们引入了 \textsc{MatViX},这是一个由 324324 篇全长研究文章和 1,6881,688 个复杂结构化 JSON 文件组成的基准,由领域专家精心整理。这些 JSON 文件从全长文档的文本、表格和图形中提取,为 MIE 提供了全面的挑战。我们引入了一种评估方法,用于评估曲线相似度的准确性和层次结构的一致性。此外,我们以零样本方式对能够处理长上下文和多模态输入的视觉语言模型(VLM)进行了基准测试,并表明使用专用模型(DePlot)可以提高曲线提取的性能。我们的结果表明,当前模型仍有很大的改进空间。我们的数据集和评估代码已公开可用\footnote{\url{https://matvix-bench.github.io/}}。

关键词

引用

@article{arxiv.2410.20494,
  title  = {MatViX: Multimodal Information Extraction from Visually Rich Articles},
  author = {Ghazal Khalighinejad and Sharon Scott and Ollie Liu and Kelly L. Anderson and Rickard Stureborg and Aman Tyagi and Bhuwan Dhingra},
  journal= {arXiv preprint arXiv:2410.20494},
  year   = {2024}
}