时间的艺术:揭示视觉语言模型中的时间结构
计算机视觉与模式识别
2025-10-23 v1 人工智能
信息检索
多媒体
摘要
大规模视觉语言模型(VLMs)如 CLIP 因其通用且富有表达力的多模态表示而受到青睐。通过利用具有多样化文本元数据的大规模训练数据,VLMs 获得了开放词汇能力,能够解决超出训练范围的任务。本文探讨了VLMs的时间意识,评估其将视觉内容定位在时间中的能力。我们引入了 TIME10k,这是一个包含超过 10,000 张带有时间真实标注的图像的数据集,并通过一种新颖的方法评估了 37 个VLMs的时间意识。我们的调查揭示,时间信息在VLM嵌入空间中沿着低维非线性流形结构化。基于这一洞察,我们提出了方法从嵌入空间中推导出显式的“时间线”表示。这些表示模型化了时间及其年代顺序,从而促进了时间推理任务。我们的时间复杂度方法在准确率上与基于提示的基线相当或更优,同时计算效率更高。所有代码和数据均可在 https://tekayanidham.github.io/timeline-page/ 获取。
引用
@article{arxiv.2510.19559,
title = {A Matter of Time: Revealing the Structure of Time in Vision-Language Models},
author = {Nidham Tekaya and Manuela Waldner and Matthias Zeppelzauer},
journal= {arXiv preprint arXiv:2510.19559},
year = {2025}
}