音频-视觉残差融合网络用于音频-视觉导航
计算机视觉与模式识别
2026-01-15 v1 人工智能
机器人学
摘要
音频-视觉具身导航旨在使智能体能够通过利用听觉线索在未看见的3D环境中自主定位和到达声源。该任务的关键挑战在于有效地建模异构特征在多模态融合中的相互作用,以避免单模态主导或信息降解,尤其是在跨域场景中。为此,我们提出了交叉模态残差融合网络,引入音频和视觉流之间的双向残差相互作用,以实现互补建模和细粒度对齐,同时保持各自表征的独立性。不同于依赖简单拼接或注意力门控的常规方法,CRFN通过残差连接显式建模跨模态相互作用,并纳入稳定技术以提高收敛性和鲁棒性。在Replica和Matterport3D数据集上的实验表明,CRFN显著优于最先进的融合基线,实现了更强的跨域泛化。值得注意的是,我们的实验还发现智能体在不同数据集中表现出不同的模态依赖性。这一发现为理解具身智能体的跨模态协作机制提供了新视角。
引用
@article{arxiv.2601.08868,
title = {Residual Cross-Modal Fusion Networks for Audio-Visual Navigation},
author = {Yi Wang and Yinfeng Yu and Bin Ren},
journal= {arXiv preprint arXiv:2601.08868},
year = {2026}
}
备注
Main paper (10 pages). Accepted for publication by the 14th international conference on Computational Visual Media (CVM 2026)