中文

面向在线动作检测的上下文增强记忆精炼 Transformer

计算机视觉与模式识别 2025-03-25 v1

摘要

在线动作检测(OAD)利用过往观测在流式视频中检测动作。最先进的 OAD 方法对过往观测及其与预期未来的交互进行建模。过往通过短期与长期记忆进行编码,以捕捉即时与长程依赖,而预期则用于补偿缺失的未来上下文。我们识别出现有 OAD 方法中存在的一种训练-推理差异,该差异阻碍了学习的有效性。训练使用可变长度的短期记忆,而推理则依赖全长的短期记忆。作为补救措施,我们提出了上下文增强记忆精炼 Transformer(CMeRT)。CMeRT 引入了一个上下文增强编码器,利用额外的近过去上下文来改进帧表征。它还具有一个记忆精炼解码器,利用近未来生成来提升性能。CMeRT 在 THUMOS'14、CrossTask 与 EPIC-Kitchens-100 数据集上的在线检测与预期任务中达到了最先进的水平。

关键词

引用

@article{arxiv.2503.18359,
  title  = {Context-Enhanced Memory-Refined Transformer for Online Action Detection},
  author = {Zhanzhong Pang and Fadime Sener and Angela Yao},
  journal= {arXiv preprint arXiv:2503.18359},
  year   = {2025}
}

备注

Accepted by CVPR 2025