用于高效视频识别的音视扫视网络
计算机视觉与模式识别
2023-08-21 v1 人工智能
多媒体
摘要
深度学习在视频理解任务中取得了显著进展,但使用片段级视频分类器对冗长海量视频进行分类所需的计算仍不切实际且极其昂贵。为此,我们提出音视扫视网络(AVGN),其利用普遍可用的音频与视觉模态来高效处理视频中时空重要的部分。AVGN首先将视频划分为图像-音频片段对,并采用轻量单模态编码器提取全局视觉特征与音频特征。为识别重要时间片段,我们使用音视时间显著性Transformer(AV-TeST)估计每帧显著性分数。为进一步提升空间维度效率,AVGN仅处理重要图像块而非整幅图像。我们使用音频增强空间块注意力(AESPA)模块生成一组增强的粗视觉特征,并将其输入策略网络以产出重要图像块的坐标。该方法使我们仅关注视频中最重要时空部分,从而实现更高效视频识别。此外,我们结合多种训练技术与多模态特征融合来增强AVGN的鲁棒性与有效性。通过组合这些策略,我们的AVGN在多个视频识别基准上树立了新的SOTA性能,同时实现了更快的处理速度。
引用
@article{arxiv.2308.09322,
title = {Audio-Visual Glance Network for Efficient Video Recognition},
author = {Muhammad Adi Nugroho and Sangmin Woo and Sumin Lee and Changick Kim},
journal= {arXiv preprint arXiv:2308.09322},
year = {2023}
}
备注
ICCV 2023