中文

视觉-语言模型在多大程度上能理解人类的意图?一项开放式心智理论问题评估基准

计算机视觉与模式识别 2025-04-25 v2 人工智能

摘要

视觉语言模型(VLM)在视觉问答(VQA)任务中已展现出强大的推理能力;然而,其在心智理论(ToM)任务(如推断人类意图、信念和心理状态)方面的表现仍缺乏充分探索。我们提出一个开放式问题框架,用于评估 VLM 在不同类别 ToM 任务上的表现。我们构建并标注了一个包含 30 张图像的基准数据集,并评估了四个不同规模的 VLM 的性能。结果显示,GPT-4 模型优于所有其他模型,仅有较小的 GPT-4o-mini 取得了与之相当的性能。我们观察到,VLM 在推断欺凌或作弊等复杂情境中的意图时往往表现不佳。我们的研究发现,较小的模型有时即便依赖于错误的视觉线索,也能推断出正确的意图。数据集已公开于 https://github.com/ximingwen/ToM-AAAI25-Multimodal。

关键词

引用

@article{arxiv.2503.22093,
  title  = {How Well Can Vison-Language Models Understand Humans' Intention? An Open-ended Theory of Mind Question Evaluation Benchmark},
  author = {Ximing Wen and Mallika Mainali and Anik Sen},
  journal= {arXiv preprint arXiv:2503.22093},
  year   = {2025}
}

备注

4 pages, accepted by ToM@AAAI25