中文

面向视频动作 anticipation 的动作引导注意力

计算机视觉与模式识别 2026-05-12 v2

摘要

在视频中预测未来动作具有挑战性,因为观察到的帧仅提供过去活动的证据,需推断潜在意图才能预测即将发生的动作。现有的基于 transformer 的方法依赖像素表示上的点积注意力,往往缺乏对视频序列有效建模所必需的高层次语义。结果是,这些方法倾向于过拟合到过去帧中显式存在的视觉线索,限制了其捕获潜在意图的能力,并降低了对未见样本的泛化能力。为此,我们提出动作引导注意力 (Action-Guided Attention, AGA),这是一种显式利用预测动作序列作为查询和键来指导序列建模的注意力机制。我们的做法促进注意力模块根据即将到来的活动重点关注过去的相关时刻,并通过专门的门控函数将此信息与当前帧嵌入相结合。AGA 的设计使能够在训练后分析从训练集中发现的知识。在广泛采用的 EPIC-Kitchens-100 基准数据集上进行实验,表明 AGA 能从验证集泛化到未见的测试集。训练后的分析进一步检查模型捕获的动作依赖关系以及其内在的反事实证据,提供了对其 anticipative 预测具有透明且可解释的洞见。

关键词

引用

@article{arxiv.2603.01743,
  title  = {Action-Guided Attention for Video Action Anticipation},
  author = {Tsung-Ming Tai and Sofia Casarin and Andrea Pilzer and Werner Nutt and Oswald Lanz},
  journal= {arXiv preprint arXiv:2603.01743},
  year   = {2026}
}

备注

Accepted by ICLR 2026