大型生成式视觉-语言模型组合性的考察
计算与语言
2024-04-02 v2 人工智能
计算机视觉与模式识别
摘要
随着大语言模型(LLMs)的成功,许多生成式视觉-语言模型(GVLMs)已通过多模态指令微调构建。然而,GVLMs 在多模态组合推理中的表现仍待充分探索。本文中,我们考察了用于评价 GVLMs 组合性的评价指标(VisualGPTScore 等)与当前基准。我们识别出当前基准中的句法偏差,该偏差被 GVLMs 的语言能力所利用。此偏差致使 VisualGPTScore 不足以评估 GVLMs。为此,我们首先引入 SyntaxBias Score,借助 LLMs 量化该偏差以作缓解。随后新增一项具挑战性的任务,以评价 GVLMs 对抗固有句法正确性倾向的鲁棒性。利用偏差缓解的数据集与新任务,我们提出一种新颖基准,即句法去偏基准(SADE)。我们的研究为 GVLMs 的组合性提供了无偏基准,促进该方向的未来研究(代码与数据集见 https://github.com/TeleeMa/SADE)。
引用
@article{arxiv.2308.10509,
title = {An Examination of the Compositionality of Large Generative Vision-Language Models},
author = {Teli Ma and Rong Li and Junwei Liang},
journal= {arXiv preprint arXiv:2308.10509},
year = {2024}
}