通过检索标签提醒多模态大语言模型对象感知知识
计算机视觉与模式识别
2024-11-13 v3 计算与语言
摘要
尽管近期在多模态大语言模型(MLLMs)的通用视觉指令跟随能力方面取得了进步,但它们在需要提供精确且详尽响应时仍面临关键问题:(1)未能识别新颖对象或实体,(2)提及不存在的对象,(3)忽视对象的属性细节。直观的解决方案包括提高数据的规模和质量,或使用更大的基础模型。它们在缓解这些问题方面有效,但代价是收集大量新数据并引入显著更大的模型。站在这些方法的交叉点上,我们从多模态连接器的图像到文本映射过程的角度考察这三个对象导向问题。在本文中,我们首先识别了由于训练数据不足而导致的多模态连接器的局限性。驱动于此,我们提出通过检索增强的标签标记来增强映射,这些标记包含丰富的对象感知信息,例如对象名称和属性。我们提出的Tag-grounded visual instruction tuning with retrieval Augmentation(TUNA)在12个基准测试中超越了共享相同语言模型和训练数据的基线方法。此外,我们展示了在提供特定数据存储时,TUNA的零样本能力。
引用
@article{arxiv.2406.10839,
title = {Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags},
author = {Daiqing Qi and Handong Zhao and Zijun Wei and Sheng Li},
journal= {arXiv preprint arXiv:2406.10839},
year = {2024}
}
备注
Main Conference at EMNLP 2024