EgoVIS@CVPR:发生了什么变化以及可能发生什么变化?面向过程感知视频表征学习的状态变化反事实
计算机视觉与模式识别
2025-09-30 v2
摘要
理解程序化活动需要建模动作步骤如何改变场景,以及不断演变的场景变化如何影响动作步骤的序列,甚至是那些意外或错误的步骤。然而,现有的过程感知视频表征工作未能显式学习状态变化(场景变换)。在本工作中,我们通过将 LLMs 生成的状态变化描述作为视频编码器的监督信号,来研究过程感知视频表征学习。此外,我们生成了模拟假设失败结果的状态变化反事实,使模型能够通过想象未见过的“假设”场景进行学习。这种反事实推理促进了模型理解活动中每个步骤因果关系的能力。为了验证我们模型的过程感知能力,我们在过程感知任务上进行了广泛实验,包括时序动作分割、错误检测等。我们的结果证明了所提出的状态变化描述及其反事实的有效性,并在多个任务上取得了显著提升。
引用
@article{arxiv.2506.00101,
title = {EgoVIS@CVPR: What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning},
author = {Chi-Hsi Kung and Frangil Ramirez and Juhyung Ha and Yi-Ting Chen and David Crandall and Yi-Hsuan Tsai},
journal= {arXiv preprint arXiv:2506.00101},
year = {2025}
}
备注
4 pages, 1 figure, 4 tables. Full paper is available at arXiv:2503.21055