TEMPURA:基于时间事件掩码的预测与推理动作理解
计算机视觉与模式识别
2025-05-06 v1 人工智能
摘要
理解因果事件关系和在视频中实现细粒度时序定位仍是视觉语言模型的挑战。现有方法要么压缩视频标记以减少时序分辨率,要么将视频视为未分段的流,导致细粒度事件边界模糊,限制了因果依赖关系的建模。我们提出TEMPURA(Temporal Event Masked Prediction and Understanding for Reasoning in Action),一个两阶段训练框架,增强视频时序理解。TEMPURA首先应用掩码事件预测推理以重建缺失事件并生成逐步的因果解释,取材于有效填充技术。TEMPURA随后学习进行视频分割和密集描述,将视频分解为带有详细、时间戳对齐描述的非重叠事件。我们在VER数据集上训练TEMPURA,该数据集由我们策划,包含100万个训练实例和50万段视频,具有时序对齐的事件描述和结构化推理步骤。在时序定位和突出显示检测基准测试中,TEMPURA超过强基线模型,证明了将因果推理与细粒度时序分割集成可提升视频理解。
引用
@article{arxiv.2505.01583,
title = {TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action},
author = {Jen-Hao Cheng and Vivian Wang and Huayu Wang and Huapeng Zhou and Yi-Hao Peng and Hou-I Liu and Hsiang-Wei Huang and Kuang-Ming Chen and Cheng-Yen Yang and Wenhao Chai and Yi-Ling Chen and Vibhav Vineet and Qin Cai and Jenq-Neng Hwang},
journal= {arXiv preprint arXiv:2505.01583},
year = {2025}
}