中文

ViFiCon:通过自监督对比学习实现视觉与无线关联

计算机视觉与模式识别 2026-04-27 v2

摘要

我们引入了 ViFiCon,这是一种自监督对比方案,旨在学习视觉模态与无线模态之间的跨模态关联。具体而言,该系统使用从 RGB-D 摄像机录像中收集的行人数据,以及来自用户智能手机设备的 WiFi 精确时间测量(FTM)数据。来自 RGB-D(视觉域)的深度数据与可观察到的行人存在内在联系,而 FTM 数据(无线域)仅与网络上的智能手机相关联。我们通过将多人深度数据序列堆叠为图像表示,来表征视觉域和无线域的时间序列。这种简单性使得既能进行场景级处理,又能减少视觉与无线特征,从而缓解了传输 IMU 数据带来的隐私与能耗问题。为促进自监督学习,我们为网络设计了一个场景级同步前置任务,随后将学习到的表示用于下游多模态关联任务。我们表明,与完全监督的 SOTA 模型相比,ViFiCon 在 25 帧滑动窗口(2.5s)方式下实现了 92.63% 的高性能视觉到无线关联,即找出哪个边界框对应哪台智能手机设备,且无需人工标注的关联样本来训练数据。大量实验结果证明,在无线数据标注稀缺时,ViFiCon 适用于真实世界系统。

关键词

引用

@article{arxiv.2210.05513,
  title  = {ViFiCon: Vision and Wireless Association Via Self-Supervised Contrastive Learning},
  author = {Nicholas Meegan and Hansi Liu and Bryan Bo Cao and Abrar Alali and Kristin Dana and Marco Gruteser and Shubham Jain and Ashwin Ashok},
  journal= {arXiv preprint arXiv:2210.05513},
  year   = {2026}
}

备注

8 pages, 6 figures, 6 tables