中文

EventTransAct:基于事件相机动作识别的视频 Transformer 框架

计算机视觉与模式识别 2023-08-29 v1 机器人学

摘要

识别和理人类动作与手势是机器人在服务机器人、医疗健康和制造等多样领域与人类交互并执行任务的关键感知需求。事件相机能够以高时间分辨率捕捉快速运动物体,相较于基于 RGB 视频的标准动作识别提供了新机会。然而,先前关于事件相机动作识别的研究主要关注传感器专用网络架构与图像编码,这可能不适合新传感器并限制近期基于 transformer 架构进展的使用。在本研究中,我们采用计算高效的模型,即视频 transformer 网络(VTN),其先对每个事件帧获取空间嵌入,然后利用时间自注意力机制。为了更好地使 VTN 适应事件数据的稀疏与细粒度特性,我们设计了事件对比损失(LEC\mathcal{L}_{EC})与事件专用增强。所提 LEC\mathcal{L}_{EC} 通过对比时间错位的帧,促进 VTN 空间骨干中学习细粒度空间线索。我们在 N-EPIC Kitchens 数据集的真实世界动作识别上评估了我们的方法,并在两种协议下均取得最先进结果——在已见厨房测试(\textbf{74.9\%} 准确率)与未见厨房测试(\textbf{42.43\% 和 46.66\% 准确率})。我们的方法相较有竞争力的先前方法也花费更少计算时间,展示了我们的框架 \textit{EventTransAct} 在基于事件相机动作识别真实世界应用中的潜力。项目页面:\url{https://tristandb8.github.io/EventTransAct_webpage/}

关键词

引用

@article{arxiv.2308.13711,
  title  = {EventTransAct: A video transformer-based framework for Event-camera based action recognition},
  author = {Tristan de Blegiers and Ishan Rajendrakumar Dave and Adeel Yousaf and Mubarak Shah},
  journal= {arXiv preprint arXiv:2308.13711},
  year   = {2023}
}

备注

IROS 2023; The first two authors contributed equally