中心舞台:基于中心度的音视频时序动作检测
计算机视觉与模式识别
2023-11-29 v1
摘要
以往的单阶段动作检测方法仅使用视觉模态建模时间依赖关系。本文中,我们探索利用多尺度交叉注意力融合音视频两种模态的不同策略。我们还展示了时间步到动作中心的距离与预测边界的精度之间的相关性。因此,我们提出一种新的网络头以估计时间步靠近动作中心的程度,称之为中心度分数。这为具有更精确边界的候选片段带来了更高的置信度。我们的方法可与其他无锚点的单阶段架构集成,并在EPIC-Kitchens-100动作检测基准的三个近期基线上进行了验证,取得了最优性能。详细的消融研究展示了融合音频与我们提出的中心度分数的益处。我们提出方法的代码和模型公开于 https://github.com/hanielwang/Audio-Visual-TAD.git
引用
@article{arxiv.2311.16446,
title = {Centre Stage: Centricity-based Audio-Visual Temporal Action Detection},
author = {Hanyuan Wang and Majid Mirmehdi and Dima Damen and Toby Perrett},
journal= {arXiv preprint arXiv:2311.16446},
year = {2023}
}
备注
Accepted to VUA workshop at BMVC 2023