用于时序动作定位的多分辨率音视特征融合
计算机视觉与模式识别
2023-10-06 v1 机器学习
多媒体
摘要
时序动作定位(TAL)旨在识别未修剪视频中动作的起始、结束和类别标签。尽管近期利用Transformer网络和特征金字塔网络(FPN)的进展增强了TAL任务中的视觉特征识别,但在将音频特征整合进此类框架方面进展较少。本文提出多分辨率音视特征融合(MRAV-FF),一种在不同时间分辨率上融合音视数据的创新方法。我们方法的核心是分层门控交叉注意力机制,它辨别性地权衡不同时间尺度下音频信息的重要性。这种技术不仅细化了回归边界的精度,还增强了分类置信度。重要的是,MRAV-FF具有通用性,可与现有FPN TAL架构兼容,并在有音频数据时显著提升性能。
引用
@article{arxiv.2310.03456,
title = {Multi-Resolution Audio-Visual Feature Fusion for Temporal Action Localization},
author = {Edward Fish and Jon Weinbren and Andrew Gilbert},
journal= {arXiv preprint arXiv:2310.03456},
year = {2023}
}
备注
Under Review