GRASP:一种评估多模态语言模型中语言接地与情境物理理解能力的新基准
计算与语言
2024-06-07 v3
摘要
本文提出 GRASP,一种用于评估基于视频的多模态大语言模型(LLM)语言接地与物理理解能力的新基准。该评估通过利用 Unity 仿真的两层方法实现。第一层通过评估模型将简单文本描述与视觉信息相关联的能力来测试语言接地。第二层评估模型对“直觉物理”原理(如物体恒存性与连续性)的理解。除发布该基准外,我们还使用它评估了若干最先进的多模态 LLM。我们的评估揭示了这些模型在语言接地与直觉物理能力上的显著不足。尽管它们至少表现出一定的接地能力(尤其是针对颜色和形状),但这些能力高度依赖于提示策略。同时,所有模型在直觉物理测试中的表现均低于或处于 50% 的随机水平,而人类受试者的平均正确率为 80%。这些已识别的局限性凸显了使用如 GRASP 之类的基准来监测未来模型在这些能力上进展的重要性。
引用
@article{arxiv.2311.09048,
title = {GRASP: A novel benchmark for evaluating language GRounding And Situated Physics understanding in multimodal language models},
author = {Serwan Jassim and Mario Holubar and Annika Richter and Cornelius Wolff and Xenia Ohmer and Elia Bruni},
journal= {arXiv preprint arXiv:2311.09048},
year = {2024}
}