中文

自编码感官替代

神经元与认知 2019-07-16 v1 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

数以千万计的人生活在盲态中,且其数量不断增加。视觉到听觉的感官替代 (SS) 涵盖一类廉价、通用的解决方案,通过声音传递视觉信息以辅助视障人士。所需的 SS 训练漫长:需数月努力才能达到实用适应水平。繁琐训练过程的原因有二:替代音频信号冗长,以及忽视人类听觉系统的压缩特性。为克服这些障碍,我们开发了一类新型 SS 方法,通过训练深度循环自编码器进行图像到声音的转换。我们成功在不同数据集上训练深度学习模型以执行视觉到听觉刺激转换。通过约束视觉空间,我们展示了缩短的替代音频信号的可行性,同时提出诸如计算听觉模型集成等机制,以在替代刺激中将视觉特征最优地传达为可感知辨别的听觉成分。我们在两个独立案例中测试了该方法。在首个实验中,作者在蒙眼状态下进行了 5 天手姿势辨别 SS 训练。第二个实验评估了朝向桌上物体的伸手运动精度。在两个测试案例中,经过数小时训练均达到了高于随机水平的精度。我们的新型 SS 架构拓宽了为视障人士设计的康复方法的前景。对所提模型的进一步改进将加速盲人康复,并随之带来 SS 设备的更广泛应用。

关键词

引用

@article{arxiv.1907.06286,
  title  = {Autoencoding sensory substitution},
  author = {Viktor Tóth and Lauri Parkkonen},
  journal= {arXiv preprint arXiv:1907.06286},
  year   = {2019}
}