面向跨视图在线动作检测的概率时序掩码注意力
计算机视觉与模式识别
2025-10-15 v2 多媒体
摘要
作为计算机视觉中视频序列分类中的关键任务, 在线动作检测(Online Action Detection, OAD)已引起广泛关注。主流 OAD 模型对不同视频视角较为敏感,导致其在面对未见视角时泛化能力受限。为此,我们提出一种新型概率时序掩码注意力(Probabilistic Temporal Masked Attention, PTMA)模型,利用概率建模在跨视图 setting 中派生视频帧的隐含压缩表示。PTMA 模型集成了基于 GRU 的时序掩码注意力(Temporal Masked Attention, TMA)单元,利用这些表示对输入视频序列进行查询,从而有效提升信息交互,促进自回归帧级视频分析。此外,可将多视角信息整合到概率建模中,以促进视角不变特征的提取。在三个评估方案下进行实验:跨主体(cross-subject, cs)、跨视角(cross-view, cv)和跨主体-视角(cross-subject-view, csv),结果表明 PTMA 在 DAHLIA、IKEA ASM 和 Breakfast 数据集上实现了最先进的性能。
引用
@article{arxiv.2508.17025,
title = {Probabilistic Temporal Masked Attention for Cross-view Online Action Detection},
author = {Liping Xie and Yang Tan and Shicheng Jing and Huimin Lu and Kanjian Zhang},
journal= {arXiv preprint arXiv:2508.17025},
year = {2025}
}
备注
12 pages, 6 figures, accepted at IEEE Transactions on Multimedia (TMM), in press