中文

空间感知条件融合用于音频-视觉导航

声音 2026-04-06 v1 人工智能 音频与语音处理

摘要

音频-视觉导航任务要求智能体仅利用视觉观测和声学线索来定位并导航至持续发声的声源。然而,现有方法主要依赖简单的特征拼接或晚期融合,缺乏对目标相对位置的显式离散表示,这限制了学习效率和泛化能力。我们提出了空间感知条件融合(SACF)。SACF 首先从音频-视觉线索中离散化目标的相对方向与距离,预测其分布,并将其编码为用于策略条件化与状态建模的紧凑描述符。然后,SACF 利用音频嵌入与空间描述符生成逐通道缩放与偏置,通过条件线性变换来调制视觉特征,生成面向目标的融合表示。SACF 以较低的计算开销提升了导航效率,并在未听目标声音上表现出良好的泛化能力。

关键词

引用

@article{arxiv.2604.02390,
  title  = {Spatial-Aware Conditioned Fusion for Audio-Visual Navigation},
  author = {Shaohang Wu and Yinfeng Yu},
  journal= {arXiv preprint arXiv:2604.02390},
  year   = {2026}
}

备注

Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)