Burn After Reading:多模态大语言模型是否真正捕捉了图像序列中的事件顺序?
计算与语言
2025-06-13 v1 计算机视觉与模式识别
摘要
本文提出了 TempVS 基准,专注于多模态大语言模型(MLLMs)在图像序列中的时间定位与推理能力。TempVS 包含三个主要测试(即事件关系推理、句子排序和图像排序),每个测试都配有基础定位测试。TempVS 要求 MLLMs 依赖视觉和语言两种模态来理解事件的时间顺序。我们评估了 38 种最先进的多模态大语言模型,结果表明模型在 TempVS 上表现不佳,与人类能力存在显著差距。我们还提供了细粒度的洞察,为未来研究指明了有前景的方向。TempVS 基准数据和代码可在 https://github.com/yjsong22/TempVS 获取。
引用
@article{arxiv.2506.10415,
title = {Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?},
author = {Yingjin Song and Yupei Du and Denis Paperno and Albert Gatt},
journal= {arXiv preprint arXiv:2506.10415},
year = {2025}
}
备注
27 pages, 14 figures. Accepted to ACL 2025