GuessBench:在自然环境中理解多模态创造力
计算与语言
2025-06-09 v2
摘要
我们提出了 GuessBench,一种新颖的基准测试,用于评估视觉语言模型(VLM)对普遍存在、嘈杂且多元的人类创造力进行建模的能力。GuessBench 的数据来源于“Guess the Build”,这是一款在线多人 Minecraft 小游戏,其中一名玩家根据给定概念(例如毛毛虫)搭建 Minecraft 建筑,其他玩家则尝试通过自然语言提示来猜测它,这为利用 VLM 作为猜测者在自然环境中理解创造力提供了一个纯粹的测试平台。我们从实际游戏过程中精选了 1500 张图像,并设计了 2000 个问题,涵盖静态与动态图像设置、不同完整度的自然语言提示等。对六款开源/API VLM 和五种推理增强方法的大量实验表明,GuessBench 在创造力建模方面提出了独特的挑战性任务:即使是处于领先水平的 GPT-4o 在 34% 的实例上也会出错,同时我们观察到开源模型与 API 模型之间存在巨大的性能差距(平均为 13.87% vs. 53.93%)。当作为提升 VLM 的资源使用时,在 GuessBench 问题的推理轨迹上进行微调,可使视觉感知任务平均提升 15.36%。进一步分析表明,VLM 在创造力理解方面的性能与概念在训练数据中出现的频率相关,而在代表性不足的文化背景与低资源语言中,其准确率会急剧下降。
引用
@article{arxiv.2506.00814,
title = {GuessBench: Sensemaking Multimodal Creativity in the Wild},
author = {Zifeng Zhu and Shangbin Feng and Herun Wan and Ningnan Wang and Minnan Luo and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2506.00814},
year = {2025}
}