中文

基于事件的视觉用于操作动作的早期预测

计算机视觉与模式识别 2023-07-27 v1 人工智能

摘要

神经形态视觉传感器是人造视网膜,当场景中出现亮度变化时会输出异步事件序列。这些传感器具有诸多优势,包括极高的时间分辨率、无运动模糊以及适合实时处理的智能数据压缩。在本研究中,我们引入了一个基于事件的细粒度操作动作数据集,并开展了关于使用Transformer进行事件动作预测的实验研究。在认知机器人和人机交互领域,尽早理解和预测人类动作引起了巨大兴趣。早期预测有助于预判复杂阶段以进行规划,从而实现有效且实时的交互。我们的Transformer网络利用事件,通过在线推理在动作发生时预测操作动作。该模型成功实现了动作的早期预测,随时间建立置信度,并达到了最先进的分类性能。此外,基于注意力的Transformer架构使我们能够研究模型所选时空模式的作用。我们的实验表明,Transformer网络捕捉了动作动态特征,优于基于视频的方法,并在动作差异仅在于极细微线索的场景中取得成功。最后,我们发布了新的事件数据集,这是文献中首个用于操作动作识别的事件数据集。代码将发布于 https://github.com/DaniDeniz/EventVisionTransformer。

关键词

引用

@article{arxiv.2307.14332,
  title  = {Event-based Vision for Early Prediction of Manipulation Actions},
  author = {Daniel Deniz and Cornelia Fermuller and Eduardo Ros and Manuel Rodriguez-Alvarez and Francisco Barranco},
  journal= {arXiv preprint arXiv:2307.14332},
  year   = {2023}
}

备注

15 pages, 9 figures