中文

用于视觉与听觉研究的 Audio-Visual BatVision 数据集

机器人学 2024-03-04 v3

摘要

视觉研究在理解世界方面取得了显著成功,这得益于图像和视频数据集。来自雷达、LiDAR 和相机的传感器数据至少十年来一直支持着机器人与自动驾驶研究。然而,虽然视觉传感器在某些条件下可能失效,声音最近显示出补充传感器数据的潜力。3D 公寓模型中模拟的房间脉冲响应(RIR)已成为社区的基准数据集,促进了一系列视听研究。在仿真中,可通过神经网络学习类蝙蝠感知从声音预测深度。同时,通过使用 RGB-D 图像和啁啾声的回声,在现实中实现了相同目标。仿生蝙蝠感知是一个令人兴奋的新方向,但需要专门的数据集来探索其潜力。因此,我们收集了 BatVision 数据集,为社区提供复杂真实场景中的大规模回声。我们为机器人装备了发射啁啾声的扬声器和记录其回声的双耳麦克风。同一视角的同步 RGB-D 图像提供了遍历空间的视觉标签。我们采样了现代美国办公空间到历史悠久的法国大学校园,室内外具有丰富的建筑多样性。该数据集将支持机器人回声定位、通用视听任务以及模拟数据中不可用的声音现象研究。我们展示了仅音频深度预测的 promising 结果,并展示了为模拟数据开发的先进工作如何也能在我们的数据集上成功。项目页面:https://amandinebtto.github.io/Batvision-Dataset/

关键词

引用

@article{arxiv.2303.07257,
  title  = {The Audio-Visual BatVision Dataset for Research on Sight and Sound},
  author = {Amandine Brunetto and Sascha Hornauer and Stella X. Yu and Fabien Moutarde},
  journal= {arXiv preprint arXiv:2303.07257},
  year   = {2024}
}

备注

Project page https://amandinebtto.github.io/Batvision-Dataset/ This version contains camera ready paper