中文

面向视觉场景自然语言理解的高效语言与视觉助手:阅读与推理中关键因素

计算机视觉与模式识别 2024-10-08 v2 计算与语言

摘要

近期语言与视觉助手的快速发展展现了惊人的能力,但因缺乏透明度而受限于更广泛的研究与可重复性。虽然开源模型在处理通用图像任务方面有效,但在处理复杂视觉场景文本理解时面临高计算需求的挑战。此类任务通常需要增加token输入和大型视觉模块以利用高分辨率信息。在模型规模与数据重要性之间取得平衡仍是一个开放问题。本研究旨在通过识别关键组件并创建具有受限推理成本的高效模型,来重新定义视觉语言模型的设计。通过战略性地构建数据集、优化视觉模块并增强监督技术,我们在保持高性能的同时显著提升了推理吞吐量。大型实验覆盖从160M到13B参数的模型,提供了模型优化的深入见解。我们将完全开源代码、模型和数据集,地址为 https://github.com/naver-ai/elva。

关键词

引用

@article{arxiv.2406.11823,
  title  = {On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning},
  author = {Geewook Kim and Minjoon Seo},
  journal= {arXiv preprint arXiv:2406.11823},
  year   = {2024}
}

备注

EMNLP 2024 Main