中文

通过状态锚定层次展开学习程序感知视频表征

计算机视觉与模式识别 2025-11-26 v1

摘要

学习程序感知视频表征是构建能够推理并执行复杂任务的智能体的关键步骤。现有方法通常通过在任务和步骤层面将视觉内容与文本描述对齐,以将程序语义注入视频表征。然而,由于其高度抽象,'任务'和'步骤'描述难以与视觉数据中具体可观察细节形成稳健的对齐。为此,我们引入'状态'(即对象配置的文本快照)作为视觉锚定语义层,将抽象程序锚定到模型实际可见的内容。我们在新颖的任务-步骤-状态(TSS)框架中正式化此见解,其中通过驱动可观察状态之间转换的步骤来实现任务。为强制此结构,我们提出一种渐进式预训练策略,用于展开TSS层次,迫使模型在关联步骤和高层任务的同时,将表征锚定在状态上。大量实验表明,我们的方法在COIN和CrossTask数据集上在多个下游任务上优于基线模型,包括任务识别、步骤识别和下一步预测。消融研究表明,引入状态监督是所有任务性能提升的关键驱动力。此外,我们的渐进式预训练策略优于标准联合训练,更有效地强制实现预期的层次结构。

关键词

引用

@article{arxiv.2511.20073,
  title  = {Learning Procedural-aware Video Representations through State-Grounded Hierarchy Unfolding},
  author = {Jinghan Zhao and Yifei Huang and Feng Lu},
  journal= {arXiv preprint arXiv:2511.20073},
  year   = {2025}
}

备注

Accepted by AAAI 2026. 15 pages, 12 figures