中文

RTime-QA:面向大型多模态模型原子时间事件理解的基准

计算机视觉与模式识别 2025-05-27 v1

摘要

理解精确的原子时间事件对于视频理解至关重要。然而,当前的视频语言基准往往无法有效评估大型多模态模型(LMM)的时间事件理解能力,因为使用图像语言模型即可有效解决这些基准。在本文中,我们引入了RTime-QA,一个专门设计用于评估LMM原子时间事件理解能力的新颖基准。RTime-QA包含822个高质量、精心策划的视频文本问题,每个问题均由人类专家细致标注。每个问题以描绘原子时间事件的视频为特征,并配有正确答案和时间负描述,专门用于评估时间理解。为提升LMM的时间事件理解能力,我们进一步引入了RTime-IT,一个采用与RTime-QA类似标注过程的14k指令微调数据集。广泛的实验分析表明,RTime-QA对LMM构成了重大挑战:最先进的模型Qwen2-VL在strict-ACC指标上仅取得34.6分,大幅落后于人类表现。此外,我们的实验表明RTime-IT有效增强了LMM在时间理解方面的能力。通过在RTime-IT上进行微调,我们的Qwen2-VL在RTime-QA上取得了65.9分。

关键词

引用

@article{arxiv.2505.19125,
  title  = {RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models},
  author = {Yuqi Liu and Qin Jin and Tianyuan Qu and Xuan Liu and Yang Du and Bei Yu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2505.19125},
  year   = {2025}
}