中文

什么改变了?什么可能改变了?面向程序感知视频表示学习的状态变化反事实

计算机视觉与模式识别 2025-08-13 v6

摘要

理解程序化活动需要建模动作步骤如何转换场景,以及演化中的场景转换如何影响动作步骤序列,甚至包括意外或错误的动作步骤。现有工作通过建模动作的时序顺序来学习程序感知视频表示,但未显式学习状态变化(场景转换)。本文通过将大型语言模型(LLM)生成的状态变化描述作为视频编码器的监督信号,来学习程序感知视频表示。此外,我们生成状态变化反事实情景,模拟假设性失败结果,使模型能够通过想象未见的“如果”情景来学习。这种反事实推理有助于模型理解活动中每个步骤的因果关系。我们在程序感知任务上进行大量实验,包括时序动作分割、错误检测、动作阶段分类、帧检索、多实例检索和动作识别。我们的结果表明,所提出的状态变化描述及其反事实情景均有效,在多个任务上取得显著改进。

关键词

引用

@article{arxiv.2503.21055,
  title  = {What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning},
  author = {Chi-Hsi Kung and Frangil Ramirez and Juhyung Ha and Yi-Ting Chen and David Crandall and Yi-Hsuan Tsai},
  journal= {arXiv preprint arXiv:2503.21055},
  year   = {2025}
}

备注

16 pages, 4 figures