面向视听导航的通用音频表示
声音
2022-06-02 v1 计算机视觉与模式识别
机器学习
机器人学
音频与语音处理
摘要
在视听导航(AVN)中,智能体需基于其音频与视觉感知在复杂 3D 环境中导航至持续发声物体。现有方法试图以精心设计的路径规划或复杂任务设置提升导航性能,却无人在任务设置不变下改进模型对未闻声音的泛化能力。我们因而提出一种基于对比学习的方法,通过正则化音频编码器应对该挑战,从而可从不同类别的多种音频信号中学得与声音无关的目标驱动潜在表示。此外,我们考虑两种数据增强策略以丰富训练声音。我们证明所设计可轻松装备于现有 AVN 框架以获得即时性能增益(Replica 上 SPL 提升 13.4%,MP3D 上 SPL 提升 12.2%)。我们的项目见 https://AV-GeN.github.io/。
引用
@article{arxiv.2206.00393,
title = {Towards Generalisable Audio Representations for Audio-Visual Navigation},
author = {Shunqi Mao and Chaoyi Zhang and Heng Wang and Weidong Cai},
journal= {arXiv preprint arXiv:2206.00393},
year = {2022}
}
备注
CVPR 2022 Embodied AI Workshop