中文

通过流形学习从音频估计视觉信息

计算机视觉与模式识别 2022-09-14 v2 多媒体 声音 音频与语音处理

摘要

我们提出了一种仅使用音频信号提取场景视觉信息的新框架。基于音频的方法可以克服基于视觉方法的一些局限性,即它们不需要“视线”,对遮挡和光照变化具有鲁棒性,并且可在视觉/激光雷达传感器失效时作为备份。因此,基于音频的方法即使在对仅视觉信息感兴趣的应用中也可能是有用的。我们的框架基于流形学习,由两步组成。首先,我们训练一个向量量化变分自编码器来学习我们感兴趣的特定视觉模态的数据流形。其次,我们训练一个音频变换网络,将多通道音频信号映射到相应视觉样本的潜在表示。我们表明,使用公开可用的音频/视觉数据集,我们的方法能够从音频生成有意义图像。具体而言,我们考虑从音频预测以下视觉模态:深度和语义分割。我们希望我们工作的发现能够促进从音频提取视觉信息的进一步研究。代码可在 https://github.com/ubc-vision/audio_manifold 获取。

关键词

引用

@article{arxiv.2208.02337,
  title  = {Estimating Visual Information From Audio Through Manifold Learning},
  author = {Fabrizio Pedersoli and Dryden Wiebe and Amin Banitalebi and Yong Zhang and George Tzanetakis and Kwang Moo Yi},
  journal= {arXiv preprint arXiv:2208.02337},
  year   = {2022}
}