中文

TRINS:面向可读性的多模态语言模型

计算机视觉与模式识别 2024-06-12 v1 人工智能

摘要

大型多模态语言模型在理解和编辑图像方面表现出惊人的能力,但大多数此类视觉调优模型在理解图像中嵌入的文本内容方面仍感到挑战,主要是由于训练数据受限。本文引入 TRINS:一个 Text-Rich image INStruction 数据集,旨在提升多模态大型语言模型的阅读能力。TRINS 基于 LAION 构建,采用机器辅助和人工辅助注释策略相结合的混合数据注释方法。数据集包含 39,153 张文本丰富的图像、描述和 102,437 个问题。具体而言,我们显示 TRINS 中每条注释的单词数显著高于相关数据集,为模型带来了新挑战。此外,我们提出了一种简单有效的架构,称为 Language-vision Reading Assistant (LaRA),擅长理解图像中的文本内容。LaRA 在 TRINS 数据集上以及其他经典基准测试中均超越了现有的 SOTA 多模态大型语言模型。最后,我们在 TRINS 上对各种文本丰富的图像理解和生成任务进行了全面评估,证明了其有效性。

关键词

引用

@article{arxiv.2406.06730,
  title  = {TRINS: Towards Multimodal Language Models that Can Read},
  author = {Ruiyi Zhang and Yanzhe Zhang and Jian Chen and Yufan Zhou and Jiuxiang Gu and Changyou Chen and Tong Sun},
  journal= {arXiv preprint arXiv:2406.06730},
  year   = {2024}
}

备注

CVPR 2024