用于第一视角动作预期的交互区域视觉Transformer
计算机视觉与模式识别
2024-01-12 v7
摘要
人-物交互是最重要的视觉线索之一,我们提出了一种新颖的方式来表示第一视角动作预期中的人-物交互。我们提出一种新颖的Transformer变体,通过计算由动作执行引起的物体与人手外观变化来建模交互,并利用这些变化精炼视频表示。具体而言,我们使用空间交叉注意力(SCA)建模手与物体间的交互,并进一步利用轨迹交叉注意力注入上下文信息以获得环境精炼的交互令牌。利用这些令牌,我们构建了以交互为中心的视频表示用于动作预期。我们将模型命名为InAViT,其在大规模第一视角数据集EPICKITCHENS100(EK100)和EGTEA Gaze+上取得了最先进的动作预期性能。InAViT优于其他基于视觉Transformer的方法,包括以物体为中心的视频表示。在EK100评估服务器上,InAViT是公开排行榜(提交时)上性能最佳的方法,其平均top5召回率优于第二名模型3.3%。
引用
@article{arxiv.2211.14154,
title = {Interaction Region Visual Transformer for Egocentric Action Anticipation},
author = {Debaditya Roy and Ramanathan Rajendiran and Basura Fernando},
journal= {arXiv preprint arXiv:2211.14154},
year = {2024}
}
备注
Top of the public leaderboard on EK100 Action Anticipation https://codalab.lisn.upsaclay.fr/competitions/702#results. Accepted at IEEE/CVF WACV 2024