中文

视觉辅助的野外声源深度估计

声音 2022-07-22 v2 音频与语音处理 图像与视频处理

摘要

深度估计使各种3D应用成为可能,例如机器人、自动驾驶和虚拟现实。尽管该领域已有大量工作,但如何实现准确、低成本、高分辨率和大范围的深度估计仍然是一个开放性问题。受“先见闪电后闻雷声”现象的启发,本文开发了FBDepth,这是第一个音视频深度估计框架。它利用光与声音的飞行时间(ToF)之差来推断声源深度。FBDepth是第一个将视频和音频与语义特征和空间线索相结合以进行距离估计的框架。它首先对齐视频轨道和音频轨道之间的对应关系,以粗粒度定位目标对象和目标声音。基于对移动物体轨迹的观察,FBDepth提出估计声音产生前后光流的交点,以在时间上定位视频事件。FBDepth将估计的视频事件时间戳和音频片段输入,进行最终的深度估计。我们使用手机收集了3000多个视频片段,包含20种不同的物体,距离最远达50m50m。与基于RGB的方法相比,FBDepth将绝对相对误差(AbsRel)降低了55%。

关键词

引用

@article{arxiv.2207.03074,
  title  = {Visual-Assisted Sound Source Depth Estimation in the Wild},
  author = {Wei Sun and Lili Qiu},
  journal= {arXiv preprint arXiv:2207.03074},
  year   = {2022}
}

备注

13 pages;in submission