CRSOT:使用未对齐帧和事件相机的跨分辨率目标跟踪
计算机视觉与模式识别
2024-01-08 v1 神经与进化计算
摘要
现有的RGB-DVS跟踪数据集使用DVS346相机采集,其分辨率(346×260)对于实际应用而言较低。实际上,许多实际系统中仅部署了可见光相机,而新设计的神经形态相机可能具有不同的分辨率。最新的神经形态传感器可以输出高清事件流,但在空间和时间视图上实现事件与帧的严格对齐非常困难。因此,如何利用未对齐的神经形态和可见光传感器实现精确跟踪是一个有价值但尚未研究的问题。本文正式提出了使用未对齐神经形态和可见光相机进行目标跟踪的任务。我们构建了首个未对齐帧-事件数据集CRSOT,该数据集使用专门搭建的数据采集系统收集,包含1,030对高清RGB-事件视频,共304,974帧。此外,我们提出了一种新颖的未对齐目标跟踪框架,即使使用松散对齐的RGB-事件数据也能实现鲁棒跟踪。具体来说,我们提取RGB和事件的模板与搜索区域,并将其输入统一的ViT骨干网络进行特征嵌入。然后,我们提出不确定性感知模块分别编码RGB和事件特征,接着提出模态不确定性融合模块以聚合两种模态。这三个分支在训练阶段联合优化。大量实验表明,即使没有严格的时间和空间对齐,我们的跟踪器也能协同双模态实现高性能跟踪。源代码、数据集和预训练模型将在https://github.com/Event-AHU/Cross_Resolution_SOT发布。
引用
@article{arxiv.2401.02826,
title = {CRSOT: Cross-Resolution Object Tracking using Unaligned Frame and Event Cameras},
author = {Yabin Zhu and Xiao Wang and Chenglong Li and Bo Jiang and Lin Zhu and Zhixiang Huang and Yonghong Tian and Jin Tang},
journal= {arXiv preprint arXiv:2401.02826},
year = {2024}
}
备注
In Peer Review