超越单帧:LMM 能否理解图像序列中的时间与上下文叙事?
计算与语言
2025-10-10 v2
摘要
大型多模态模型(LMM)在各种视觉语言任务中取得了显著成功。然而,现有的基准测试主要关注单图像理解,对图像序列的分析在很大程度上尚未探索。为了解决这一局限性,我们引入了 StripCipher,这是一个旨在评估 LMM 理解和推理连续图像能力的综合基准测试。StripCipher 包含一个人工标注的数据集和三个具有挑战性的子任务:视觉叙事理解、上下文帧预测和时间叙事重排序。我们对包括 GPT-4o 和 Qwen2.5VL 在内的 16 个最先进的 LMM 进行了评估,结果显示与人类能力相比存在显著的性能差距,特别是在需要对打乱的连续图像进行重排序的任务中。例如,GPT-4o 在重排序子任务中的准确率仅为 23.93%,比人类表现低 56.07%。进一步的定量分析讨论了图像输入格式等影响 LLM 在序列理解中性能的几个因素,强调了 LMM 发展中仍然存在的根本挑战。
引用
@article{arxiv.2502.13925,
title = {Beyond Single Frames: Can LMMs Comprehend Temporal and Contextual Narratives in Image Sequences?},
author = {Xiaochen Wang and Heming Xia and Jialin Song and Longyu Guan and Yixin Yang and Qingxiu Dong and Weiyao Luo and Yifan Pu and Yiru Wang and Xiangdi Meng and Wenjie Li and Zhifang Sui},
journal= {arXiv preprint arXiv:2502.13925},
year = {2025}
}