中文

稠密多标签动作检测的有效高效方法

计算机视觉与模式识别 2024-06-11 v1

摘要

与稀疏标签动作检测任务不同,稠密多标签场景下,动作可以在视频的每个时间戳上重叠。为解决这一挑战性任务,需同时学习 (i) 时序依赖性,和 (ii) 动作共现关系。近期方法通过基于层次变换器网络提取多尺度特征来建模时序信息。然而,变换器中的自注意力机制本质上会丢失时序位置信息。我们认为,层次设计中与之结合的多次子采样进程会进一步导致位置信息丢失。保留这些信息对准确动作检测至关重要。本文提出一种新型基于变换器的网络,该网络 (a) 在建模不同时序依赖范围时采用非层次结构,和 (b) 在其变换器层中嵌入相对位置编码。此外,为建模动作共现关系,现有方法会显式地将类别关系嵌入变换器网络。然而,这些方法计算效率不高,因为网络需要计算所有可能的动作类别关系。我们还通过引入一种新颖的学习范式,使网络能够在推理期间无需额外计算成本,即可受益于显式建模时序动作共现依赖。我们在两套挑战性稠密多标签基准数据集上评估了所提方法,结果表明本方法改进了当前的最先进(SOTA)结果。

关键词

引用

@article{arxiv.2406.06187,
  title  = {An Effective-Efficient Approach for Dense Multi-Label Action Detection},
  author = {Faegheh Sardari and Armin Mustafa and Philip J. B. Jackson and Adrian Hilton},
  journal= {arXiv preprint arXiv:2406.06187},
  year   = {2024}
}

备注

14 pages. arXiv admin note: substantial text overlap with arXiv:2308.05051