中文

InstrAct:面向指令视频的行动中心理解

计算机视觉与模式识别 2026-04-13 v1 人工智能

摘要

理解指令视频需要识别细粒度动作并建模其时间关系,这一挑战仍在当前视频基础模型(VFMs)面临。这种困难源于噪声网络监督以及普遍存在的“静态偏见”——模型依赖对象而非运动线索。为此,我们提出 InstrAction,一种针对指令视频行动中心表示的预训练框架。我们首先引入数据驱动的策略,过滤噪声标题并生成行动中心的硬负样本,以在对比学习中解耦动作与对象。于是,在视觉特征层面,一个行动 Perceiver 从冗余的视频编码中提取与运动相关的 token。除对比学习外,我们引入两个辅助目标:动态时间变形对齐(DTW-Align)用于建模顺序时间结构,以及掩码行动建模(MAM)用于加强跨模态对齐。最后,我们引入 InstrAct Bench 来评估行动中心理解,其中我们的方法在语义推理、程序逻辑和细粒度检索任务上 consistently 超过最新的 VFMs。

关键词

引用

@article{arxiv.2604.08762,
  title  = {InstrAct: Towards Action-Centric Understanding in Instructional Videos},
  author = {Zhuoyi Yang and Jiapeng Yu and Reuben Tan and Boyang Li and Huijuan Xu},
  journal= {arXiv preprint arXiv:2604.08762},
  year   = {2026}
}