中文

基于对比阅读模型与冻结大语言模型的视觉情境自然语言理解

计算与语言 2023-10-27 v2 人工智能

摘要

大语言模型(LLMs)近期的进展激发了大量旨在将其应用扩展至视觉领域的研究。尽管这些模型在生成抽象图像描述与促进自然对话方面展现出潜力,其在富含文本的图像上的表现仍有待提升。本文引入对比阅读模型(Cream),一种新颖的神经架构,旨在通过捕捉现有方法中常被忽视的细微细节,增强 LLM 的语言-图像理解能力。Cream 结合视觉与辅助编码器,并借助对比特征对齐技术加以强化,以在图像内的视觉情境上下文中实现对语言信息更有效的理解。我们的方法弥合了视觉与语言理解之间的鸿沟,为开发更先进的文档智能助手铺平道路。通过在要求推理能力的多样化视觉情境语言理解任务上的严格评估,我们展示了 Cream 的优异性能,将其定位为视觉文档理解领域的重要模型。我们在 https://github.com/naver-ai/cream 提供了代码库与新生成的数据集。

关键词

引用

@article{arxiv.2305.15080,
  title  = {Visually-Situated Natural Language Understanding with Contrastive Reading Model and Frozen Large Language Models},
  author = {Geewook Kim and Hodong Lee and Daehee Kim and Haeji Jung and Sanghee Park and Yoonsik Kim and Sangdoo Yun and Taeho Kil and Bado Lee and Seunghyun Park},
  journal= {arXiv preprint arXiv:2305.15080},
  year   = {2023}
}

备注

22 pages; To appear at EMNLP 2023 Main Conference (Project page: https://naver-ai.github.io/cream )