中文

是时候把它弄对了:提高视觉语言模型中模拟时钟阅读和时针空间推理能力

计算机视觉与模式识别 2026-05-26 v2

摘要

视觉语言模型(VLM)在复杂多模态推理任务上取得了显著成功,导致人们认为它们也应该在阅读模拟时钟方面表现出色。然而,与这一期望相反,我们的研究发现,在真实环境中读取模拟时钟仍然是当前最先进VLM面临的重大挑战。现有的模拟时钟数据集大多为合成或平面结构,样式多样性有限且背景上下文最小,无法捕捉真实场景的视觉变异性。结果是,训练此类数据集的VLM在时空推理方面表现薄弱,经常混淆时针和分针,在常见视觉条件下(如遮挡、光照变化和杂乱背景)也难掌握。为此,我们引入TickTockVQA,一个包含多样化真实场景下模拟时钟的人工标注数据集。TickTockVQA提供明确的时针和分针标注,并在可从视觉上下文推断出的情况下包含AM/PM标签。此外,我们提出Swap-DPO,一种基于直接偏好优化的微调框架,以准确解释时间的方式指导模型推理。实验结果表明,我们的方法在真实条件下显著提升了时钟阅读准确性和鲁棒性,为未来VLM中时空推理和视觉理解研究奠定了基础。

关键词

引用

@article{arxiv.2603.08011,
  title  = {It's Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models},
  author = {Jaeha Choi and Jin Won Lee and Siwoo You and Jangho Lee},
  journal= {arXiv preprint arXiv:2603.08011},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Findings