瞬息即时动作 anticipation:多模态线索能否取代视频?
计算机视觉与模式识别
2025-12-03 v1
摘要
在行动理解研究中,预测动作发生前的动作是核心挑战。虽然传统方法依赖从视频中提取和聚合时序信息,但人类往往可以通过观察场景中的单个瞬间就能预测即将发生的动作,这取决于是否提供足够的上下文。本文探讨了视频聚合能否被替代的程度。为此,基于最近的视觉特征提取和语言推理进展,我们引入了 AAG(Action Anticipation at a Glimpse)方法。AAG 将 RGB 特征与单帧深度线索结合以增强空间推理,并整合先验动作信息以提供长期上下文。这种上下文通过来自视觉-语言模型的文本摘要,或来自单帧动作识别器的预测获得。我们的结果表明,利用 AAG 进行的多模态单帧动作 anticipation 能在三个指令活动数据集(IKEA-ASM、Meccano 和 Assembly101)上与时序聚合视频基线和最新方法相抗衡。
关键词
引用
@article{arxiv.2512.02846,
title = {Action Anticipation at a Glimpse: To What Extent Can Multimodal Cues Replace Video?},
author = {Manuel Benavent-Lledo and Konstantinos Bacharidis and Victoria Manousaki and Konstantinos Papoutsakis and Antonis Argyros and Jose Garcia-Rodriguez},
journal= {arXiv preprint arXiv:2512.02846},
year = {2025}
}
备注
Accepted in WACV 2026 - Applications Track