Lost in Time:多模态大语言模型中的时钟和日历理解挑战
计算机视觉与模式识别
2025-03-19 v2 人工智能
计算与语言
摘要
从视觉表征中理解时间是一种基本认知技能,但仍是多模态大语言模型(MLLM)面临的挑战。本文探讨了 MLLM 在通过模拟时钟和年度日历解释时间和日期方面的能力。为此,我们构建了一个结构化数据集,包含两个子集:1)包含多种时钟样式(标准时钟、黑色表盘时钟、无秒针时钟、罗马数字时钟、箭头时钟)并配有时序问题的 ClockQA;以及 2)包含年度日历图像的问题集合,问题范围从常已知日期(如圣诞节、新年日)到计算推导日期(如一年中的第 100 天或第 153 天)。我们旨在分析 MLLM 在面对时序视觉数据时的视觉识别、数值推理和时序推断能力。我们的评估表明,尽管近期取得了进展,但可靠地理解时间仍是 MLLM 的重要挑战。
引用
@article{arxiv.2502.05092,
title = {Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs},
author = {Rohit Saxena and Aryo Pradipta Gema and Pasquale Minervini},
journal= {arXiv preprint arXiv:2502.05092},
year = {2025}
}
备注
Accepted at the ICLR 2025 Workshop on Reasoning and Planning for Large Language Models