中文

ChEF:用于多模态大语言模型标准化评估的综合评估框架

计算机视觉与模式识别 2023-11-07 v1

摘要

多模态大语言模型(MLLMs)在与视觉内容进行交互方面展现出令人印象深刻的能力,并具有大量潜在的下游任务。然而,尽管已提出一系列基准测试,但由于缺乏标准化且整体的评估框架,MLLMs 的能力与局限仍未被全面理解。为此,我们提出首个综合评估框架(ChEF),可整体刻画每个 MLLM 并公平比较不同的 MLLM。首先,我们将 ChEF 构建为四个模块化组件,即可扩展多模态数据集的情境(Scenario)、灵活指令检索公式的指令(Instruction)、可靠问答策略的推理器(Inferencer)以及指示性任务特定评分函数的度量(Metric)。基于这些组件,ChEF 在标准化框架中促进多样化评估,且可通过设计新配方(Recipe,即对上述四组件的系统选择)来构建新评估。值得注意的是,当前 MLLM 基准可轻易概括为 ChEF 的配方。其次,我们引入 6 个新配方,以量化胜任的 MLLM 所需能力(或称期望属性,即校准、上下文学习、指令遵循、语言表现、幻觉与鲁棒性),将其作为可执行真实世界多模态交互的可靠智能体。第三,我们在 9 个情境与 6 项期望属性上对 9 个知名 MLLM 进行了大规模评估。我们的评估总结了 20 余条关于 MLLM 跨情境泛化性以及多模态交互所需 MLLM 复合能力的宝贵观察。我们将公开所有详细实现以供进一步分析,以及一个易于使用的模块化工具包用于集成新配方与模型,从而使 ChEF 成为 MLLM 社区不断发展的评估框架。

关键词

引用

@article{arxiv.2311.02692,
  title  = {ChEF: A Comprehensive Evaluation Framework for Standardized Assessment of Multimodal Large Language Models},
  author = {Zhelun Shi and Zhipin Wang and Hongxing Fan and Zhenfei Yin and Lu Sheng and Yu Qiao and Jing Shao},
  journal= {arXiv preprint arXiv:2311.02692},
  year   = {2023}
}

备注

39 pages, 26 figures