中文

IWISDM:在大规模多模态模型上评估指令遵循能力

人工智能 2024-07-23 v5

摘要

从详细指令中执行复杂任务的能力是许多惊人成就的关键。作为人类,我们不仅能够执行各种各样的任务,而且非常擅长执行可能包含数百或数千个步骤的复杂任务。大型语言模型及其更近期的多模态对等物将文本和视觉输入集成在一起,在执行复杂任务方面取得了前所未有的成功。然而,大多数现有基准测试主要局限于单一模态输入(要么是文本,要么是视觉),限制了多模态情境下的指令遵循评估的范围。为填补这一差距,我们引入了instructed-Virtual VISual Decision Making(iWISDM)环境,该环境被设计用于生成不同复杂度的视觉语言任务的无限数组。使用iWISDM,我们编译了三个不同指令遵循视觉任务的基准测试,涵盖不同复杂度水平,并对几款新开发的多模态模型在这些基准测试上进行了评估。我们的发现表明,iWISDM是一个评估现有和新兴多模态模型指令遵循能力的稳健基准测试,同时也凸显了这些模型在精确遵循指令方面存在较大差距。iWISDM的代码已在GitHub上提供:https://github.com/BashivanLab/iWISDM。

关键词

引用

@article{arxiv.2406.14343,
  title  = {IWISDM: Assessing instruction following in multimodal models at scale},
  author = {Xiaoxuan Lei and Lucas Gomez and Hao Yuan Bai and Pouya Bashivan},
  journal= {arXiv preprint arXiv:2406.14343},
  year   = {2024}
}