GlitchBench:大型多模态模型能检测视频游戏故障吗?
计算机视觉与模式识别
2024-04-01 v2 人工智能
计算与语言
摘要
大型多模态模型(LMMs)已从大型语言模型发展而来,以整合多种输入模态,例如视觉输入。这种整合增强了 LLMs 在需要视觉理解和推理的任务中的能力。然而,其增强能力的范围和局限性尚未被完全理解,尤其是在涉及真实世界任务时。为了填补这一空白,我们引入了 GlitchBench,一个源自视频游戏质量保证任务的新颖基准,用于测试和评估 LMMs 的推理能力。我们的基准精选自视频游戏中各种异常和故障场景,旨在挑战 LMMs 在检测和解释非同寻常事件时的视觉和语言推理能力。我们评估了多个最先进的 LMMs,并表明 GlitchBench 对这些模型提出了新的挑战。代码和数据可在:https://glitchbench.github.io 获取。
引用
@article{arxiv.2312.05291,
title = {GlitchBench: Can large multimodal models detect video game glitches?},
author = {Mohammad Reza Taesiri and Tianjun Feng and Anh Nguyen and Cor-Paul Bezemer},
journal= {arXiv preprint arXiv:2312.05291},
year = {2024}
}
备注
CVPR 2024