中文

ViFiT:从IMU和Wi-Fi精细时间测量重建视觉轨迹

计算机视觉与模式识别 2023-10-06 v1 多媒体

摘要

在视频中跟踪目标是基于摄像头的物联网应用中最广泛使用的功能之一,如安全监控、智慧城市交通安全提升、车到行人通信等。在计算机视觉领域,跟踪通常先通过边界框检测目标,再跨视频帧关联检测到的边界框来实现。对于许多物联网系统,摄像头捕获的图像通常通过网络发送到具有比边缘设备更强计算资源的异地处理。然而,通过网络发送完整帧会造成显著的带宽消耗,可能超出系统带宽限制。为解决此问题,我们提出ViFiT,一种基于transformer的模型,可从手机数据(IMU和精细时间测量)重建视觉边界框轨迹。它利用了transformer更好建模长期时间序列数据的能力。ViFiT在Vi-Fi数据集上评估,该数据集为包含室内外5种多样真实场景的大规模多模态数据集。为弥补同时刻画跟踪质量与视频带宽降低系统特性的合适指标之缺失,我们提出一种称为最小所需帧数(MRF)和最小所需帧数比率(MRFR)的新评估框架。ViFiT达到0.65的MRFR,优于跨模态重建的SOTA方法LSTM编解码器架构X-Translator的0.98,实现高达97.76%的帧减少率。

关键词

引用

@article{arxiv.2310.03140,
  title  = {ViFiT: Reconstructing Vision Trajectories from IMU and Wi-Fi Fine Time Measurements},
  author = {Bryan Bo Cao and Abrar Alali and Hansi Liu and Nicholas Meegan and Marco Gruteser and Kristin Dana and Ashwin Ashok and Shubham Jain},
  journal= {arXiv preprint arXiv:2310.03140},
  year   = {2023}
}

备注

22 pages, 12 figures, 9 tables. MobiCom 2023 ISACom