时空提示网络用于鲁棒视频特征提取
计算机视觉与模式识别
2024-02-07 v1 机器学习
摘要
帧质量退化是视频理解领域的主要挑战之一。为了补偿退化帧造成的信息损失,近期方法利用基于Transformer的集成模块来获取时空信息。然而,这些集成模块庞大且复杂。此外,每个集成模块都是针对其目标任务专门定制的,难以泛化到多个任务。本文提出一个简洁统一的框架,称为时空提示网络(STPN)。它能够通过动态调整骨干网络中的输入特征,高效提取鲁棒且准确的视频特征。具体来说,STPN预测多个包含相邻帧时空信息的视频提示。然后,这些视频提示被前置到当前帧的块嵌入中,作为视频特征提取的更新输入。此外,STPN易于泛化到各种视频任务,因为它不包含任务特定模块。无需额外修饰,STPN在三个广泛使用的视频理解任务数据集上取得了最先进的性能,即用于视频目标检测的ImageNetVID、用于视频实例分割的YouTubeVIS和用于视觉目标跟踪的GOT-10k。代码可在https://github.com/guanxiongsun/vfe.pytorch获取。
引用
@article{arxiv.2402.02574,
title = {Spatio-temporal Prompting Network for Robust Video Feature Extraction},
author = {Guanxiong Sun and Chi Wang and Zhaoyu Zhang and Jiankang Deng and Stefanos Zafeiriou and Yang Hua},
journal= {arXiv preprint arXiv:2402.02574},
year = {2024}
}