TimeLogic:视频问答的时间逻辑基准
计算机视觉与模式识别
2025-01-14 v1
摘要
时间逻辑理解是人类认知的核心方面,在捕捉视频中复杂的序列事件及其时间关系方面起着关键作用。这种能力在视频问答等任务中尤为重要,其目标是随时间处理视觉数据以及文本数据以提供连贯的答案。然而,当前的视频问答基准很少关注评估这一关键技能,因为标注时间逻辑具有挑战性。尽管视觉语言模型取得了进展,但评估它们的时间逻辑推理能力仍然是一个挑战,主要是由于缺乏需要形式化、复杂时间推理的问答对。为了弥补这一差距,我们引入了TimeLogic QA(TLQA)框架来自动生成问答对,专门设计用于评估时间逻辑理解。为此,TLQA利用现有视频数据集中的时间标注以及从逻辑理论中推导出的时间算子来构建测试事件序列及其时间关系理解的问题。TLQA框架是通用且可扩展的,能够利用现有的带有时间动作分割标注的视频动作数据集,或带有时间场景图标注的视频数据集,来自动生成时间逻辑问题。我们利用了四个数据集:STAR、Breakfast、AGQA和CrossTask,并为每个类别生成了两个视频问答数据集变体——小型(TLQA-S)和大型(TLQA-L),分别包含2k和10k个问答对,每个数据集总计32k和160k对。我们使用TLQA对前沿的视频问答模型进行了全面评估,以基准测试它们的时间逻辑理解能力。我们评估了视频问答模型在16个时间逻辑类别上的时间推理性能,这些类别具有不同的时间复杂度。
引用
@article{arxiv.2501.07214,
title = {TimeLogic: A Temporal Logic Benchmark for Video QA},
author = {Sirnam Swetha and Hilde Kuehne and Mubarak Shah},
journal= {arXiv preprint arXiv:2501.07214},
year = {2025}
}