连续环境中的语义音视频导航
计算机视觉与模式识别
2026-04-02 v1 声音
摘要
音视频导航使具身智能体能够通过利用听觉和视觉线索导航至声源目标。然而,大多数现有方法依赖预计算的房间脉冲响应(RIRs)用于声呈渲染,将智能体限制在离散网格位置,导致空间上不连续的观察。在更真实的 setting 下,我们引入持续环境语义音视频导航(SAVN-CE),其中智能体可以在3D空间中自由移动并感知随时间和空间连贯的音视频流。在此 setting 下,目标可能间歇性地变得沉默或完全不发声,导致智能体丢失目标信息。为应对这一挑战,我们提出MAGNet,一种基于多模态Transformer的模型,联合编码空间和语义目标表征,整合历史上下文和自运动线索以实现记忆增强的目标推理。综合实验表明,MAGNet显著优于当前最先进的方法,在成功率上提升最高可达12.1%。这些结果也显示其对短时声音和长距离导航情景的鲁棒性。代码地址为https://github.com/yichenzeng24/SAVN-CE。
引用
@article{arxiv.2603.19660,
title = {Semantic Audio-Visual Navigation in Continuous Environments},
author = {Yichen Zeng and Hebaixu Wang and Meng Liu and Yu Zhou and Chen Gao and Kehan Chen and Gongping Huang},
journal= {arXiv preprint arXiv:2603.19660},
year = {2026}
}
备注
This paper has been accepted to CVPR 2026