中文

KOSMOS-2.5:一种多模态文本理解模型

计算与语言 2024-08-22 v2 计算机视觉与模式识别

摘要

文本密集图像的自自动读取是实现通用人工智能(AGI)的重要进展。本文中我们提出 KOSMOS-2.5,一种用于文本密集图像机器读取的多模态文本理解模型(multimodal literate model)。在大规模文本密集图像语料上预训练后,KOSMOS-2.5 擅长两个不同但互补的转录任务:(1)生成空间感知的文本块,其中每个文本块在图像内被赋予空间坐标;(2)生成捕获样式与结构(以 markdown 格式)的结构化文本输出。这一统一的多模态文本理解能力通过共享的仅解码器自回归 Transformer 架构与任务特定提示实现。在此基础之上,我们将 KOSMOS-2.5 微调用于文档理解任务,得到名为 KOSMOS-2.5-CHAT 的文档理解通才。此外,我们策划了跨越多样领域、包含 3.574 亿文档页的大规模语料用于预训练。我们在两个新提出的基准 OCREval 与 MarkdownEval 上评估 KOSMOS-2.5,用于文档级文本识别与图像到 markdown 生成,展示了可与 GPT-4o 媲美的出色文本理解能力。KOSMOS-2.5-CHAT 在九个文本丰富视觉问答基准上取得了与大五倍(1.3B vs. 7B)的其他 SOTA 通才相当的性能。模型与代码已发布于 \url{https://aka.ms/kosmos25}。

关键词

引用

@article{arxiv.2309.11419,
  title  = {KOSMOS-2.5: A Multimodal Literate Model},
  author = {Tengchao Lv and Yupan Huang and Jingye Chen and Yuzhong Zhao and Yilin Jia and Lei Cui and Shuming Ma and Yaoyao Chang and Shaohan Huang and Wenhui Wang and Li Dong and Weiyao Luo and Shaoxiang Wu and Guoxin Wang and Cha Zhang and Furu Wei},
  journal= {arXiv preprint arXiv:2309.11419},
  year   = {2024}
}