机器人语音源定位综述:聚焦深度学习方法
机器人学
2025-08-29 v1 机器学习
声音
音频与语音处理
摘要
语音源定位 (SSL) 为听觉感知添加了空间维度,使系统能够定位语音、机械噪声、警报音或其他声学事件的来源,这些能力有助于机器人导航、人机对话和状态监测。虽然现有综述提供了宝贵的历史背景,但它们通常涉及一般音频应用,且未充分考虑机器人约束或最新深度学习的最新进展。本综述弥补了这些差距,通过提供面向机器人的综合,强调近期在深度学习方法方面的进展。我们首先回顾经典方法,如到达时差 (TDOA)、波束成形、驾驶响应功 (SRP) 和子空间分析。随后,我们深入探讨现代机器学习 (ML) 和深度学习 (DL) 方法,讨论传统 ML 和神经网络 (NN)、卷积神经网络 (CNN)、卷积循环神经网络 (CRNN) 以及新兴注意力机制架构。探索了 SSL 基于深度学习的数据和训练策略这两个基石。进一步按机器人类型和应用领域对研究进行分类,以帮助研究人员确定适用于其特定情境的相关工作。最后,我们指出 SSL 在一般情况下的当前挑战,包括环境鲁棒性、声源多性以及机器人中的特定实现约束,以及基于深度学习的 SSL 中的数据和学习策略。我们还勾勒出面向下一代机器人实现稳健、可适应、高效和可解释的基于深度学习的 SSL 的可行道路。
引用
@article{arxiv.2507.01143,
title = {A Review on Sound Source Localization in Robotics: Focusing on Deep Learning Methods},
author = {Reza Jalayer and Masoud Jalayer and Amirali Baniasadi},
journal= {arXiv preprint arXiv:2507.01143},
year = {2025}
}
备注
35 pages