利用视觉Transformer挖掘事件相机的空间稀疏性
计算机视觉与模式识别
2022-02-11 v1
摘要
事件相机通过异步输出事件流报告亮度的局部变化。在亮度变化较小的像素位置,事件在空间上是稀疏的。我们提出使用视觉Transformer(ViT)架构以利用其处理可变长度输入的能力。ViT的输入由累积到时间箱中并在空间上分隔为称为图像块的非重叠子区域的事件组成。当子区域内的非零像素位置数量超过阈值时,选择该图像块。我们表明,通过在选定的活动图像块上微调ViT模型,我们可以在N-Caltech101数据集上分类精度仅微降(0.34%)的情况下,将推理期间输入骨干网络的平均图像块数量减少至少50%。这一减少转化为乘加(MAC)运算减少51%,以及在使用服务器CPU时推理速度提升46%。
关键词
引用
@article{arxiv.2202.05054,
title = {Exploiting Spatial Sparsity for Event Cameras with Visual Transformers},
author = {Zuowen Wang and Yuhuang Hu and Shih-Chii Liu},
journal= {arXiv preprint arXiv:2202.05054},
year = {2022}
}