中文

面向弱监督时序动作定位的视频特定查询-键注意力建模

计算机视觉与模式识别 2023-12-27 v3

摘要

弱监督时序动作定位旨在仅利用视频级动作标签,在未裁剪视频中识别并定位动作实例。人类观看视频时,能适配不同视频场景下关于动作的抽象级知识,并检测某些动作是否发生。本文模仿人类行为,为视频中多动作定位与识别带来新视角。我们提出名为 VQK-Net 的网络,通过视频特定查询-键注意力建模,为每输入视频的每个动作类别学习唯一查询。所学查询既包含抽象级动作知识特征,又具备将该知识拟合至目标视频场景的能力,并用于沿时间维度检测相应动作的存在。为更好学习这些动作类别查询,我们不仅利用当前输入视频特征,还通过一种新颖的视频特定动作类别查询学习器与查询相似度损失,挖掘不同视频间关联。最后,我们在三个常用数据集(THUMOS14、ActivityNet1.2 与 ActivityNet1.3)上开展充分实验,取得最先进性能。

关键词

引用

@article{arxiv.2305.04186,
  title  = {Video-Specific Query-Key Attention Modeling for Weakly-Supervised Temporal Action Localization},
  author = {Xijun Wang and Aggelos K. Katsaggelos},
  journal= {arXiv preprint arXiv:2305.04186},
  year   = {2023}
}