中文

面向跨视图在线动作检测的概率时序掩码注意力

计算机视觉与模式识别 2025-10-15 v2 多媒体

摘要

作为计算机视觉中视频序列分类中的关键任务, 在线动作检测(Online Action Detection, OAD)已引起广泛关注。主流 OAD 模型对不同视频视角较为敏感,导致其在面对未见视角时泛化能力受限。为此,我们提出一种新型概率时序掩码注意力(Probabilistic Temporal Masked Attention, PTMA)模型,利用概率建模在跨视图 setting 中派生视频帧的隐含压缩表示。PTMA 模型集成了基于 GRU 的时序掩码注意力(Temporal Masked Attention, TMA)单元,利用这些表示对输入视频序列进行查询,从而有效提升信息交互,促进自回归帧级视频分析。此外,可将多视角信息整合到概率建模中,以促进视角不变特征的提取。在三个评估方案下进行实验:跨主体(cross-subject, cs)、跨视角(cross-view, cv)和跨主体-视角(cross-subject-view, csv),结果表明 PTMA 在 DAHLIA、IKEA ASM 和 Breakfast 数据集上实现了最先进的性能。

关键词

引用

@article{arxiv.2508.17025,
  title  = {Probabilistic Temporal Masked Attention for Cross-view Online Action Detection},
  author = {Liping Xie and Yang Tan and Shicheng Jing and Huimin Lu and Kanjian Zhang},
  journal= {arXiv preprint arXiv:2508.17025},
  year   = {2025}
}

备注

12 pages, 6 figures, accepted at IEEE Transactions on Multimedia (TMM), in press