Move2Hear:主动视听声源分离
计算机视觉与模式识别
2021-08-27 v2 机器学习
机器人学
声音
音频与语音处理
摘要
我们提出了主动视听声源分离问题,其中智能体必须智能地移动,以更好地分离其环境中感兴趣对象发出的声音。该智能体同时听到多个音频源(例如,在嘈杂家庭中走廊尽头有人说话),并且必须利用视觉与听觉,在有限的时间预算内自动分离出目标对象发出的声音。针对这一目标,我们提出了一种强化学习方法,训练控制智能体相机与麦克风随时间放置位置的移动策略,以预测音频分离质量的提升作为引导。我们在增强现实(系统已与目标对象共置)与移动机器人(智能体初始距目标对象任意远)两种动机场景中对方法进行了演示。利用最先进的真实三维环境视听仿真,我们展示了模型在为音频声源分离寻找收益最大化的极小移动序列方面的能力。项目主页:http://vision.cs.utexas.edu/projects/move2hear。
引用
@article{arxiv.2105.07142,
title = {Move2Hear: Active Audio-Visual Source Separation},
author = {Sagnik Majumder and Ziad Al-Halah and Kristen Grauman},
journal= {arXiv preprint arXiv:2105.07142},
year = {2021}
}
备注
Accepted to ICCV 2021