基于立体声感知注意力的音频引导动态模态融合用于音频-视觉导航
人工智能
2025-09-23 v1 声音
摘要
在音频-视觉导航(AVN)任务中,具身智能体必须在未知且复杂的3D环境中基于音频-视觉信号自动定位声源。现有方法常依赖静态模态融合策略,忽视立体音频中蕴含的空间线索,导致在杂乱或遮挡场景中性能下降。为解决此问题,本文提出一种基于终端强化学习的AVN框架,具有两个关键创新:(1)立体声感知注意力模块(SAM),学习并利用左右音频通道之间的空间视差来增强方向声感知;(2)音频引导动态融合模块(AGDF),根据音频线索动态调整视觉与听觉特征之间的融合比例,从而提高对环境变化的鲁棒性。在两个真实3D场景数据集(Replica和Matterport3D)上进行大量实验,表明该方法在导航成功率和路径效率方面显著优于现有方法。在仅使用音频条件下,本模型相较于最佳基线方法实现了40%以上的提升。这些结果凸显了在声学通道中显式建模空间线索和进行深度多模态融合对实现稳健高效的音频-视觉导航的重要性。
引用
@article{arxiv.2509.16924,
title = {Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation},
author = {Jia Li and Yinfeng Yu and Liejun Wang and Fuchun Sun and Wendong Zheng},
journal= {arXiv preprint arXiv:2509.16924},
year = {2025}
}
备注
Main paper (14 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025