中文

视频语言模型中的深度时间推理:通过 Perfect Times 对动作持续时间和完成度的跨语言评估

计算机视觉与模式识别 2025-06-03 v1 计算与语言

摘要

人类对事件的感知本质上与区分已完成(完成体和有界)和进行中(持续)动作相关联,这一过程由语言结构和视觉线索共同介导。在这项工作中,我们引入了 \textbf{Perfect Times} 数据集,这是一个新颖的四语种(英语、意大利语、俄语和日语)多选题问答基准,旨在评估视频语言模型(VLM)的时间推理能力。通过将日常活动视频与事件完成标签和为完成体量身定制的干扰项配对,我们的数据集探究了模型是真正理解了时间动态,还是仅仅依赖于表面标记。实验结果表明,SOTA 模型尽管在基于文本的任务中取得了成功,但在反映基于视频的类人时间和因果推理方面仍存在困难。本研究强调了整合深度多模态线索以捕捉时间和因果视频动态中动作持续时间和完成度细微差别的必要性,为评估和推进 VLM 中的时间推理设定了新标准。

关键词

引用

@article{arxiv.2506.00928,
  title  = {Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times},
  author = {Olga Loginova and Sofía Ortega Loguinova},
  journal= {arXiv preprint arXiv:2506.00928},
  year   = {2025}
}