文本即图像:多模态大语言模型能否遵循像素中的印刷指令?
计算机视觉与模式识别
2024-06-12 v2 人工智能
计算与语言
摘要
近来的多模态大语言模型(MLLM)在视觉-语言任务上展现出有前景的指令遵循能力。本工作中,我们引入视觉模态指令(VIM),并研究多模态模型在预训练或微调期间未显式训练此类数据的情况下,能在多大程度上理解以像素形式给出的文本指令。我们将 VIM 适配到八个基准上,包括 OKVQA、MM-Vet、MathVista、MMMU,并在文本模态指令(TEM)设置与 VIM 设置下探测多种 MLLM。值得注意的是,我们观察到开源 MLLM 在原始 TEM 与 VIM 设置间存在显著性能差距,表明当文本指令仅以图像形式呈现时,开源 MLLM 面临更大挑战。为应对该问题,我们训练了 v-MLLM,一种能够在文本模态与视觉模态指令下均进行鲁棒指令遵循的通用模型。
引用
@article{arxiv.2311.17647,
title = {Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?},
author = {Xiujun Li and Yujie Lu and Zhe Gan and Jianfeng Gao and William Yang Wang and Yejin Choi},
journal= {arXiv preprint arXiv:2311.17647},
year = {2024}
}
备注
Github: https://github.com/VIM-Bench/VIM_TOOL, Model and Data: https://huggingface.co/VIM-Bench