语义视听导航
计算机视觉与模式识别
2021-04-08 v2 机器学习
机器人学
声音
音频与语音处理
摘要
近期视听导航工作假设目标持续发声,并将音频作用限制为指示目标位置。我们引入语义视听导航,其中环境中物体发出与其语义意义一致的声音(例如马桶冲水、门吱呀作响),且声学事件是零星或短时的。我们提出一种基于 transformer 的模型来解决这一新语义 AudioGoal 任务,该模型融入推断的目标描述符,捕获目标的空间与语义属性。我们模型的持久多模态记忆使其即使在声学事件停止后很久也能到达目标。为支持新任务,我们还扩展了 SoundSpaces 音频仿真,为 Matterport3D 中一系列物体提供语义基础的发声。我们的方法通过学会关联语义、声学与视觉线索,大幅优于现有视听导航方法。
引用
@article{arxiv.2012.11583,
title = {Semantic Audio-Visual Navigation},
author = {Changan Chen and Ziad Al-Halah and Kristen Grauman},
journal= {arXiv preprint arXiv:2012.11583},
year = {2021}
}
备注
Project page: http://vision.cs.utexas.edu/projects/semantic-audio-visual-navigation