积分化 affordances 与注意力模型以实现短期物体交互预测
计算机视觉与模式识别
2026-02-17 v1
摘要
短期物体交互预测涉及从观察 egonic 视频中检测下一个活跃物体的位置、名词和动词类别,以及接触时间。这种能力对可穿戴助手理解用户目标、提供及时帮助或实现人机交互至关重要。本文提出一种方法提高 STA 预测性能。我们的贡献有两方面:1 我们提出 STAformer 和 STAformer plus plus 两种新型注意力架构,集成帧导向的时间池化、双图像-视频注意力和多尺度特征融合,以支持来自图像输入视频对的 STA 预测;2 我们引入两个新模块,通过建模人类行为将 STA 预测 grounded 在 affordances 上。首先,我们集成环境 affordance 模型作为给定物理场景可发生交互的持久记忆。我们探讨如何通过简单晚期融合以及自适应学习如何最佳融合 affordances 与 end-to-end 预测。其次,我们从观察手部和物体轨迹预测交互热点,增加围绕热点局部化的 STA 预测置信度。我们的结果在 Overall Top-5 mAP 上取得显著改进,Ego4D 上提升最高达 +23p.p,新建的 EPIC-Kitchens STA 标签上提升 +31p.p。我们发布了代码、注释和预提取的 affordances 以鼓励该领域的未来研究。
引用
@article{arxiv.2602.14837,
title = {Integrating Affordances and Attention models for Short-Term Object Interaction Anticipation},
author = {Lorenzo Mur Labadia and Ruben Martinez-Cantin and Jose J. Guerrero and Giovanni M. Farinella and Antonino Furnari},
journal= {arXiv preprint arXiv:2602.14837},
year = {2026}
}