中文

V2V:通过高效视频到体素仿真扩展基于事件的视觉

计算机视觉与模式识别 2025-05-23 v1

摘要

基于事件的相机具有高时间分辨率、高动态范围和低功耗等独特优势。然而,现有合成数据生成管道的巨大存储需求和 I/O 负担,加上真实数据的稀缺,导致基于事件的训练数据集难以扩大,限制了事件视觉模型的发展和泛化能力。为此,我们引入 Video-to-Voxel (V2V),一种直接将conventional video 帧转换为基于事件的体素网格表示的方法,完全绕过存储密集的事件流生成。V2V 实现了 150 倍的存储需求降低,同时支持 on-the-fly 参数随机化以增强模型鲁棒性。凭借这种效率,我们在 10,000 个多样化视频(总计 52 小时)上训练了多个视频重建和光流估计模型架构,数据规模是现有事件数据集的一个数量级,显著提升了性能。

关键词

引用

@article{arxiv.2505.16797,
  title  = {V2V: Scaling Event-Based Vision through Efficient Video-to-Voxel Simulation},
  author = {Hanyue Lou and Jinxiu Liang and Minggui Teng and Yi Wang and Boxin Shi},
  journal= {arXiv preprint arXiv:2505.16797},
  year   = {2025}
}