基于频率自适应声场预测的 Audio-Visual Navigation Sim2Real 迁移
声音
2024-09-12 v2 人工智能
机器学习
机器人学
音频与语音处理
摘要
Sim2Real 迁移因在仿真中端到端学习机器人任务而受到越来越多的关注。虽然在将视觉导航策略迁移方面取得了许多进展,但现有的 Audio-Visual Navigation sim2Real 策略是通过经验性数据增强来实现的,而未实际衡量声学差距。声音与光线不同之处在于其频率跨度更广,从而需要不同的 sim2Real 解决方案。我们首次针对 Audio-Visual Navigation 提出 sim2Real 处理方案,将其解耦为声场预测 (AFP) 和路径点导航。我们首先在 SoundSpaces 仿真器中验证了设计选择,并在 Continuous AudioGoal 导航基准测试中取得改进。随后我们收集了真实世界数据,通过仅使用特定频率子带作为输入来训练 AFP 模型,以衡量仿真与真实世界之间的谱差。我们进一步提出一种频率自适应策略,智能地根据测量的谱差和收到音频的能量分布选择最佳频率带进行预测,从而在真实数据上取得性能提升。最后,我们构建了一个真实机器人平台,表明迁移后的策略能够成功导航至发出声响的物体。本工作表明,从仿真中进行全感知智能体的构建以及将其迁移到真实世界具有潜在可能性。
引用
@article{arxiv.2405.02821,
title = {Sim2Real Transfer for Audio-Visual Navigation with Frequency-Adaptive Acoustic Field Prediction},
author = {Changan Chen and Jordi Ramos and Anshul Tomar and Kristen Grauman},
journal= {arXiv preprint arXiv:2405.02821},
year = {2024}
}
备注
Camera ready version for IROS 2024. Project page: https://vision.cs.utexas.edu/projects/sim2real/