对音视觉导航施加自注意力
声音
2022-10-06 v2 人工智能
音频与语音处理
摘要
音视觉具身导航作为一个热门研究方向,旨在训练机器人利用以自我为中心的视觉(来自机器人搭载的传感器)和音频(由目标发出)输入到达音频目标。音视觉信息融合策略对导航性能自然重要,但最先进方法仍简单拼接视觉与音频特征,可能忽略上下文的直接影响。此外,现有方法要么需要分阶段训练,要么需要额外辅助(如拓扑图与声音语义)。迄今,处理含移动目标的更具挑战性设定的工作仍稀少。为此,我们提出端到端框架FSAAVN(特征自注意力音视觉导航),利用实现为自注意力模块的上下文感知音视觉融合策略,学习追逐移动音频目标。我们充分的实验验证了FSAAVN相较最先进方法的优越性能(定量与定性上),并提供了关于视觉模态、视觉/音频编码器骨干及融合模式选择的独到见解。
引用
@article{arxiv.2210.01353,
title = {Pay Self-Attention to Audio-Visual Navigation},
author = {Yinfeng Yu and Lele Cao and Fuchun Sun and Xiaohong Liu and Liejun Wang},
journal= {arXiv preprint arXiv:2210.01353},
year = {2022}
}
备注
Main paper (10 pages and 7 figures) and appendix (21 figures and 4 tables). Accepted for publication by BMVC 2022. For data and code, see https://yyf17.github.io/FSAAVN/index.html