CAST:用于视频动作识别的时空交叉注意力
计算机视觉与模式识别
2024-09-04 v2
摘要
识别视频中的人体动作需要空间与时间理解。大多数现有动作识别模型缺乏对视频均衡的时空理解。在本工作中,我们提出一种新颖的双流架构,称为时空交叉注意力(Cross-Attention in Space and Time, CAST),仅使用RGB输入即可实现对视频均衡的时空理解。我们提出的瓶颈交叉注意力机制使空间与时间专家模型能够交换信息并做出协同预测,从而提升性能。我们在具有不同特性的公开基准EPIC-KITCHENS-100、Something-Something-V2和Kinetics-400上通过大量实验验证了所提方法。我们的方法在这些数据集上一致表现出良好性能,而现有方法的性能随数据集特性波动。
引用
@article{arxiv.2311.18825,
title = {CAST: Cross-Attention in Space and Time for Video Action Recognition},
author = {Dongho Lee and Jongseo Lee and Jinwoo Choi},
journal= {arXiv preprint arXiv:2311.18825},
year = {2024}
}
备注
This is an accepted NeurIPS 2023. Project webpage is available at https://jong980812.github.io/CAST.github.io/ Code is available at https://github.com/KHU-VLL/CAST