基于 GCC-PHAT 特征的 BatVision 实现更优的声音到视觉预测
计算机视觉与模式识别
2020-06-16 v1 机器人学
声音
音频与语音处理
摘要
受自然界中复杂的回声定位能力启发,我们训练了一个生成对抗网络,从声音预测合理的深度图和灰度布局。为此,我们的声音到视觉模型处理来自啁啾声的双耳回声。我们基于先前使用 BatVision 的工作,该工作包含一个声音到视觉模型以及一个使用我们的移动机器人和低成本硬件自采集的数据集。我们通过引入几项模型改进,提升了深度和灰度估计以及感知质量。我们不再使用原始双耳波形作为输入,而是生成广义互相关(GCC)特征并将其作为输入。此外,我们改变了模型生成器,使其基于残差学习,并在判别器中使用谱归一化。我们比较并展示了相对于先前 BatVision 模型在定量和定性方面的改进。
引用
@article{arxiv.2006.07995,
title = {BatVision with GCC-PHAT Features for Better Sound to Vision Predictions},
author = {Jesper Haahr Christensen and Sascha Hornauer and Stella Yu},
journal= {arXiv preprint arXiv:2006.07995},
year = {2020}
}