基于注意力模型的 Ego4D 短期物体互动预测挑战:利用可 affordances 和注意力模型进行 STA
计算机视觉与模式识别
2024-07-08 v1
摘要
短期物体互动预测 (STA) 涉及从观察三维视频中检测下一个活跃物体的位置、互动的名词和动词类别,以及与之接触的时间。我们提出 STAformer,一种新型注意力架构集成帧导向的时间池化、双图像-视频注意力和多尺度特征融合,以支持来自图像输入视频对的 STA 预测。此外,我们引入两个新模块来建模人类行为的可 affordances。首先,我们集成一个环境 affordances 模型,作为给定物理场景中可能发生的互动的持久记忆。其次,我们从观察手部和物体轨迹来预测互动热点,增加围绕热点位置的 STA 预测的可信度。在测试集上,我们的结果在 v2 训练数据集上获得最终 33.5 N mAP、17.25 N+V mAP、11.77 N+{\delta} mAP 和 6.75 Overall top-5 mAP 指标。
引用
@article{arxiv.2407.04369,
title = {ZARRIO @ Ego4D Short Term Object Interaction Anticipation Challenge: Leveraging Affordances and Attention-based models for STA},
author = {Lorenzo Mur-Labadia and Ruben Martinez-Cantin and Josechu Guerrero-Campo and Giovanni Maria Farinella},
journal= {arXiv preprint arXiv:2407.04369},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2406.01194