面向视觉场景自然语言理解的高效语言与视觉助手:阅读与推理中关键因素
计算机视觉与模式识别
2024-10-08 v2 计算与语言
摘要
近期语言与视觉助手的快速发展展现了惊人的能力,但因缺乏透明度而受限于更广泛的研究与可重复性。虽然开源模型在处理通用图像任务方面有效,但在处理复杂视觉场景文本理解时面临高计算需求的挑战。此类任务通常需要增加token输入和大型视觉模块以利用高分辨率信息。在模型规模与数据重要性之间取得平衡仍是一个开放问题。本研究旨在通过识别关键组件并创建具有受限推理成本的高效模型,来重新定义视觉语言模型的设计。通过战略性地构建数据集、优化视觉模块并增强监督技术,我们在保持高性能的同时显著提升了推理吞吐量。大型实验覆盖从160M到13B参数的模型,提供了模型优化的深入见解。我们将完全开源代码、模型和数据集,地址为 https://github.com/naver-ai/elva。
关键词
引用
@article{arxiv.2406.11823,
title = {On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning},
author = {Geewook Kim and Minjoon Seo},
journal= {arXiv preprint arXiv:2406.11823},
year = {2024}
}
备注
EMNLP 2024 Main