利用分时空注意力机制在第一人称视频中进行物体状态变化分类
计算机视觉与模式识别
2023-01-05 v2
摘要
本报告描述了我们名为“TarHeels”的、提交给 Ego4D:物体状态变化分类挑战赛的方案。我们使用基于 transformer 的视频识别模型,并利用分时空注意力(Divided Space-Time Attention)机制对第一人称视频中的物体状态变化进行分类。我们的提交在挑战赛中取得了第二好的性能。此外,我们进行了消融研究以表明,在第一人称视频中识别物体状态变化需要时间建模能力。最后,我们给出了若干正例与负例来可视化我们模型的预测。代码公开于:https://github.com/md-mohaiminul/ObjectStateChange
引用
@article{arxiv.2207.11814,
title = {Object State Change Classification in Egocentric Videos using the Divided Space-Time Attention Mechanism},
author = {Md Mohaiminul Islam and Gedas Bertasius},
journal= {arXiv preprint arXiv:2207.11814},
year = {2023}
}
备注
2nd place winner, Ego4D challenge, CVPR 2022