通过双耳差异注意力和动作转移预测实现可泛化的视听导航
声音
2026-04-08 v1 人工智能
音频与语音处理
摘要
在视听导航中,智能体必须利用视觉和听觉线索在未见过的3D环境中定位声源。然而,现有方法在未见场景中往往难以泛化,因为它们倾向于过拟合语义声音特征和特定的训练环境。为了解决这些挑战,我们提出了**双耳差异注意力与动作转移预测**框架,该框架联合优化感知和策略。具体来说,**双耳差异注意力**模块显式建模耳间差异以增强空间定向,减少对语义类别的依赖。同时,**动作转移预测**任务引入了一个辅助动作预测目标作为正则化项,减轻了环境特定的过拟合。在Replica和Matterport3D数据集上的大量实验表明,BDATP可以无缝集成到各种主流基线中,并产生一致且显著的性能提升。值得注意的是,我们的框架在大多数设置中实现了最先进的成功率,在Replica数据集的未听过声音上实现了高达21.6个百分点的绝对提升。这些结果强调了BDATP优越的泛化能力及其在不同导航架构中的鲁棒性。
引用
@article{arxiv.2604.05007,
title = {Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction},
author = {Jia Li and Yinfeng Yu},
journal= {arXiv preprint arXiv:2604.05007},
year = {2026}
}
备注
Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)