音频空间引导融合用于音频-视觉导航
声音
2026-04-06 v1 人工智能
音频与语音处理
摘要
音频-视觉导航指智能体在复杂三维环境中利用视觉与听觉信息来完成目标定位与路径规划,从而实现自主导航。该任务的核心挑战在于:智能体如何在面对环境与声源变化时摆脱对训练数据的依赖,实现具有良好泛化性能的自主导航。为解决这一挑战,我们提出了一种音频-视觉导航的音频空间引导融合方法。首先,我们设计了一个音频空间特征编码器,通过音频强度注意力机制自适应地提取与目标相关的空间状态信息;在此基础上,我们引入了音频空间状态引导融合(ASGF),以实现多模态特征的动态对齐与自适应融合,有效缓解了由感知不确定性引起的噪声干扰。在 Replica 和 Matterport3D 数据集上的实验结果表明,我们的方法在未听任务上尤为有效,证明了在未知声源分布下泛化能力的提升。
引用
@article{arxiv.2604.02389,
title = {Audio Spatially-Guided Fusion for Audio-Visual Navigation},
author = {Xinyu Zhou and Yinfeng Yu},
journal= {arXiv preprint arXiv:2604.02389},
year = {2026}
}
备注
Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)