理解单帧动作预热的多模态互补性
计算机视觉与模式识别
2026-01-30 v1
摘要
人类动作预热通常被视为视频理解问题,隐含假设需要密集的时间信息来推理未来动作。本文通过研究在单一视觉观察下受限于动作预热的可能性,挑战了这一假设。我们提出一个根本性问题:单帧中已编码了多少关于未来动作的信息,如何有效地加以利用?基于我们先前的“一瞥动作预热”(Action Anticipation at a Glimpse, AAG)工作,我们系统性地调查了单帧动作预热融合互补信息源的情况。我们分析了RGB外观、基于深度的几何线索以及过去动作语义表示的贡献,探讨了不同的多模态融合策略、关键帧选择策略和过去动作历史来源如何影响预热性能。根据这些发现,我们将最有效的设计选择整合到AAG+,一个细化的单帧预热框架。尽管仅基于单帧,AAG+始终改进了原始AAG,实现了在挑战性预热基准(包括IKEA-ASM、Meccano和Assembly101)上的与最先进视频方法相当或更好的性能。我们的结果为单帧动作预热的界限和潜力提供了新见解,阐明了稠密时间建模何时是必要的,何时 carefully selection的瞬视足以胜任。
引用
@article{arxiv.2601.22039,
title = {Understanding Multimodal Complementarity for Single-Frame Action Anticipation},
author = {Manuel Benavent-Lledo and Konstantinos Bacharidis and Konstantinos Papoutsakis and Antonis Argyros and Jose Garcia-Rodriguez},
journal= {arXiv preprint arXiv:2601.22039},
year = {2026}
}