UniDoc:一种用于同步文本检测、识别、定位与理解的统一大型多模态模型
人工智能
2023-09-06 v2 计算与语言
摘要
在大型语言模型(LLMs)时代,多模态理解领域已取得巨大进展。然而,现有先进算法在有效利用这些大型预训练模型固有的强大表示能力与丰富世界知识方面存在局限,且文本丰富场景下各任务间的有益联系尚未被充分探索。本工作中,我们提出 UniDoc,一种具备文本检测与识别能力(现有方法所欠缺)的新型多模态模型。此外,UniDoc 利用任务间有益交互来提升各单独任务的性能。为实现 UniDoc,我们在所贡献的大规模指令跟随数据集上进行了统一多模态指令微调。定量与定性实验结果表明,UniDoc 在多个具挑战性基准上确立了最先进(SOTA)分数。据我们所知,这是首个能够同步进行文本检测、识别、定位与理解的大型多模态模型。
引用
@article{arxiv.2308.11592,
title = {UniDoc: A Universal Large Multimodal Model for Simultaneous Text Detection, Recognition, Spotting and Understanding},
author = {Hao Feng and Zijian Wang and Jingqun Tang and Jinghui Lu and Wengang Zhou and Houqiang Li and Can Huang},
journal= {arXiv preprint arXiv:2308.11592},
year = {2023}
}