GliTr:具有时空一致性的瞥见Transformer用于在线动作预测
计算机视觉与模式识别
2023-04-20 v2
摘要
许多在线动作预测模型观察完整帧以定位并关注帧中称为瞥见(glimpse)的信息子区域,并基于全局与局部信息识别正在进行的动作。然而,在资源受限的应用中,智能体可能无法观察完整帧,但仍必须定位有用瞥见以仅基于局部信息预测不完整的动作。本文中,我们提出瞥见Transformer(GliTr),其始终仅观察窄瞥见,从而基于迄今收集的局部时空信息预测正在进行的动作及下一个最具信息量的瞥见位置。在缺乏动作识别最优瞥见位置真值的情况下,我们使用一种新颖的时空一致性目标训练GliTr:我们要求GliTr关注其特征与对应完整帧相似的瞥见(即空间一致性),且在时间得到的类别logits等同于使用截至的完整帧所预测的logits(即时间一致性)。引入我们提出的一致性目标在Something-Something-v2(SSv2)数据集上比基线交叉熵目标准确率提高约10%。总体而言,尽管每帧仅观察约33%的总面积,GliTr在SSv2和Jester数据集上分别达到53.02%和93.91%的准确率。
引用
@article{arxiv.2210.13605,
title = {GliTr: Glimpse Transformers with Spatiotemporal Consistency for Online Action Prediction},
author = {Samrudhdhi B Rangrej and Kevin J Liang and Tal Hassner and James J Clark},
journal= {arXiv preprint arXiv:2210.13605},
year = {2023}
}
备注
Accepted to WACV 2023