抗干扰的音频-视觉导航
声音
2022-02-23 v1 计算机视觉与模式识别
机器人学
音频与语音处理
摘要
音频-视觉导航任务要求智能体利用以自我为中心的音频-视觉观测,在真实的未建图 3D 环境中找到声源。现有音频-视觉导航工作假设环境中仅有目标声音,不含其他声响,然而由于意外的声音噪声或有意干扰,该假设在大多数现实应用中并不成立。本工作中,我们设计了一个声学复杂环境,其中除目标声音外,还存在一个与智能体进行零和博弈的声音攻击者。具体而言,攻击者可以移动并改变声音的音量与类别,使智能体难以找到发声物体,而智能体则试图躲避攻击并在干预下导航至目标。在对攻击者施加一定约束的条件下,我们可提升智能体在音频-视觉导航中对意外声音攻击的鲁棒性。为更好收敛,我们利用集中式评论员与分散式执行者的性质,开发了联合训练机制。在 Replica 与 Matterport3D 两个真实世界 3D 扫描数据集上的实验验证了在所设计环境下训练的智能体迁移至干净环境或含随机策略声音攻击者的环境时的有效性与鲁棒性。项目:\url{https://yyf17.github.io/SAAVN}。
引用
@article{arxiv.2202.10910,
title = {Sound Adversarial Audio-Visual Navigation},
author = {Yinfeng Yu and Wenbing Huang and Fuchun Sun and Changan Chen and Yikai Wang and Xiaohong Liu},
journal= {arXiv preprint arXiv:2202.10910},
year = {2022}
}
备注
This work aims to do an adversarial sound intervention for robust audio-visual navigation