中文

mPLUG-PaperOwl:基于多模态大语言模型的科学图表分析

多媒体 2024-01-10 v2 计算与语言

摘要

近来,大语言模型(LLMs)强大的文本生成能力催生了许多辅助论文阅读甚至写作的工具。然而,LLMs 或多模态大语言模型(Multimodal LLMs)较弱的图表分析能力极大限制了其应用场景,尤其是对于科学学术论文写作。本工作中,为构建更通用的论文写作辅助系统,我们主要致力于增强多模态大语言模型的多模态图表分析能力。通过解析高质量论文的 LaTeX 源文件,我们精心构建了多模态图表理解数据集 M-Paper。通过将论文中的图表与相关段落对齐,我们构建了专业的图表分析样本用于训练与评估。M-Paper 是首个支持多科学图表联合理解的数据集,涵盖以图像或 LaTeX 代码形式呈现的图与表。此外,为使辅助系统更好地与用户意图对齐,我们引入“大纲”作为控制信号,其可由用户直接给出或基于自动生成的大纲进行修改。基于最先进的多模态大语言模型开展的全面实验表明,在我们的数据集上训练可展现出更强的科学图表理解性能,包括图表描述、图表分析与大纲推荐。数据集、代码与模型已发布于 https://github.com/X-PLUG/mPLUG-DocOwl/tree/main/PaperOwl。

关键词

引用

@article{arxiv.2311.18248,
  title  = {mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model},
  author = {Anwen Hu and Yaya Shi and Haiyang Xu and Jiabo Ye and Qinghao Ye and Ming Yan and Chenliang Li and Qi Qian and Ji Zhang and Fei Huang},
  journal= {arXiv preprint arXiv:2311.18248},
  year   = {2024}
}

备注

20 pages, 12 figures