ActiveRIR:用于声学环境建模的主动视听探索
计算机视觉与模式识别
2024-04-26 v1 机器人学
声音
音频与语音处理
摘要
环境声学模型表示声音如何被室内环境的物理特性所变换,针对任意给定的声源/接收器位置。构建声学模型的传统方法涉及在空间中密集空间位置收集大量声学数据,成本高昂且耗时,或者依赖于对场景几何的先验知识来智能选择声学数据采样位置。我们提出了主动声学采样,这是一项新任务,用于高效构建未映射环境的环境声学模型,其中配备视觉和声学传感器的移动代理联合构建环境声学模型和占用地图,并实时进行。我们引入了ActiveRIR,一种强化学习(RL)策略,利用来自视听传感器流的信息来引导代理导航并确定最佳声学数据采样位置,从而从最少的声学样本中生成高质量的环境声学模型。我们使用基于环境声学模型中信息增益的新型RL奖励来训练我们的策略。在来自最先进声学仿真平台的多样化未见室内环境上进行评估,ActiveRIR优于一系列方法——包括基于空间新颖性和视觉探索的传统导航代理以及现有的最先进方法。
引用
@article{arxiv.2404.16216,
title = {ActiveRIR: Active Audio-Visual Exploration for Acoustic Environment Modeling},
author = {Arjun Somayazulu and Sagnik Majumder and Changan Chen and Kristen Grauman},
journal= {arXiv preprint arXiv:2404.16216},
year = {2024}
}
备注
Project page: https://vision.cs.utexas.edu/projects/active_rir/