音频引导的视觉感知用于音频-视觉导航
声音
2025-10-15 v1 人工智能
计算机视觉与模式识别
多媒体
摘要
音频-视觉本体化导航旨在使智能体能够使用听觉线索在未知3D 环境中自主导航至声源位置。虽然当前的AVN 方法在分布内声源上表现出色,但在跨源泛化方面表现poor:当智能体遇到未听过的声源或未见的环境时,导航成功率会骤降且搜索路径显得过长。这种限制源于听觉信号与相应视觉区域之间缺乏显式对齐机制。策略倾向于在训练期间记忆特定的“声学指纹-情景”相关性,导致在面对新声源时进行盲目探索。为此,我们提出了AGVP 框架,将声音从策略可记忆的声学指纹线索转化为空间指导。该框架首先通过音频自注意力提取全局听觉上下文,然后将此上下文作为查询来指导视觉特征注意力,从而在特征级别突出与声源相关的区域。随后进行时间建模和策略优化。该设计以可解释的跨模态对齐和区域重加权为中心,减少了对特定声学指纹的依赖。实验结果表明,AGVP 在提高导航效率和鲁棒性方面取得显著效果,并在之前未听过的声源上实现卓越的跨情景泛化。
引用
@article{arxiv.2510.11760,
title = {Audio-Guided Visual Perception for Audio-Visual Navigation},
author = {Yi Wang and Yinfeng Yu and Fuchun Sun and Liejun Wang and Wendong Zheng},
journal= {arXiv preprint arXiv:2510.11760},
year = {2025}
}
备注
Main paper (6 pages). Accepted for publication by International Conference on Virtual Reality and Visualization 2025 (ICVRV 2025)