RoSS:利用机器人旋转进行音频源分离
声音
2022-03-21 v1 机器人学
音频与语音处理
摘要
本文考虑音频源分离问题,其目标是从多个干扰信号(例如多人同时说话)的混合中隔离出目标音频信号(比如 Alice 的语音)。该问题因语音控制设备(包括家庭、办公室及其他公共场所中的机器人)的显著增长而重新受到关注。尽管关于源分离核心主题已有丰富研究,我们发现麦克风的机器人运动——例如机器人的头部——是相对于过往方法的一个互补机会。简言之,我们展示将麦克风阵列旋转至正确朝向可在两个干扰源间产生所需的混叠,使二者表现为一个。换言之,K 个信号的混合变为 (K-1) 个信号的混合,这是一种数学上明确的增益。我们展示只要能缓解两个与移动性相关的挑战,该增益就能很好地转化到实践中。本文聚焦于缓解这些挑战,并在全功能原型上展示端到端性能。我们相信我们的旋转源分离模块 RoSS 可插入实际机器人头部,或插入其他也能旋转的设备(如 Amazon Show)中。
引用
@article{arxiv.2203.10072,
title = {RoSS: Utilizing Robotic Rotation for Audio Source Separation},
author = {Hyungjoo Seo and Sahil Bhandary Karnoor and Romit Roy Choudhury},
journal= {arXiv preprint arXiv:2203.10072},
year = {2022}
}
备注
8 pages, 13 figures