Dragonfly:多分辨率缩放编码增强视觉语言模型
计算机视觉与模式识别
2024-10-16 v2 人工智能
摘要
视觉语言模型(VLM)的最新进展已证明了以更高分辨率处理图像以及利用多裁剪特征来保留原生分辨率细节的优势。然而,尽管有这些改进,现有的视觉Transformer(ViT)仍然难以从不太突出的物体、图表和嵌入文本中捕捉细粒度细节,限制了它们在特定任务中的有效性。在本文中,我们扩展了近期的高分辨率和多裁剪技术,不仅保留了原生分辨率,还进一步放大并提取了大量图像子裁剪的特征。这种增强使我们的模型能够更好地捕捉细粒度细节,克服了当前ViT的局限性。为了管理增加的标记数量和计算复杂度,我们证明了在标记上进行简单的均值池化聚合是有效的。我们的模型Dragonfly在通用领域任务(如ScienceQA和AI2D)上取得了有竞争力的性能,并在需要细粒度图像理解的任务(包括TextVQA和ChartQA)中表现出色。在7-8B参数范围内的模型中,Dragonfly在十个通用领域基准测试中始终名列前茅,在大多数情况下取得最高或第二高的分数,优于那些规模更大或在更大数据集上训练的模型。我们的生物医学模型Dragonfly-Med在多项医学任务上树立了新标杆,在SLAKE上达到91.6%的准确率(Med-Gemini为84.8%),在Path-VQA上达到67.1%的标记F1分数(Med-PaLM M为62.7%),并在大多数图像描述任务中取得了最先进的结果。总体而言,我们的工作凸显了使用固定分辨率ViT设计视觉表示所面临的持续挑战,并提出了一种简单而有效的解决方案来解决这个问题,并在通用和专业领域提升性能。
引用
@article{arxiv.2406.00977,
title = {Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models},
author = {Rahul Thapa and Kezhen Chen and Ian Covert and Rahul Chalamala and Ben Athiwaratkun and Shuaiwen Leon Song and James Zou},
journal= {arXiv preprint arXiv:2406.00977},
year = {2024}
}