中文

EvtSlowTV——用于基于事件的深度估计的大规模多样化数据集

计算机视觉与模式识别 2025-11-06 v1 人工智能 机器学习 机器人学

摘要

事件相机凭借其高动态范围(HDR)和低延迟,为在挑战性环境中进行鲁棒的深度估计提供了一种有前景的替代方案。然而,许多基于事件的深度估计方法受限于小规模标注数据集,限制了它们对真实世界场景的泛化能力。为了弥补这一差距,我们引入了EvtSlowTV,这是一个从公开的YouTube视频中整理的大规模事件相机数据集,包含超过130亿个事件,涵盖了各种环境条件和运动,包括季节性徒步、飞行、风景驾驶和水下探索。EvtSlowTV比现有事件数据集大一个数量级,为基于事件的深度学习提供了一个无约束的、自然的环境。这项工作展示了EvtSlowTV适用于自监督学习框架,以利用原始事件流的高动态范围潜力。我们进一步证明,使用EvtSlowTV进行训练增强了模型泛化到复杂场景和运动的能力。我们的方法消除了对基于帧的标注的需求,并保留了事件数据的异步特性。

关键词

引用

@article{arxiv.2511.02953,
  title  = {EvtSlowTV -- A Large and Diverse Dataset for Event-Based Depth Estimation},
  author = {Sadiq Layi Macaulay and Nimet Kaygusuz and Simon Hadfield},
  journal= {arXiv preprint arXiv:2511.02953},
  year   = {2025}
}