中文

面向噪声鲁棒声源定位的高效 GPU 实现

声音 2025-05-09 v2 机器人学 音频与语音处理

摘要

机器人听觉系统包括声源定位(SSL)、声源分离(SSS)和自动语音识别(ASR),使机器人和智能设备获得类似人类听觉的能力。尽管具有广泛应用前景,但在 SSL 中处理多通道音频信号涉及计算密集型矩阵运算,可能阻碍在资源有限的嵌入式系统中高效部署于中央处理器(CPU)。本文介绍了一种基于 GPU 的 SSL 实现,采用广义奇异值分解基于信号分类(GSVD-MUSIC)的噪声鲁棒算法 within HARK 平台,该平台是一个开源软件套件。对于 60 通道麦克风阵列,该实现实现了显著的性能提升。在配备 NVIDIA GPU 和 ARM Cortex-A78AE v8.2 64 位 CPU 的 Jetson AGX Orin 嵌入式设备上,我们观察到 GSVD 计算速度提升了 5648.7 倍,SSL 模块提升了 10.7 倍;在配备 NVIDIA A100 GPU 和 AMD EPYC 7352 CPU 的服务器上,GSVD 计算提升了 4245.1 倍,整个 SSL 模块提升了 17.3 倍,使大型麦克风阵列的实时处理成为可能,并为后续机器学习或深度学习任务提供了充足的实时处理能力。

关键词

引用

@article{arxiv.2504.03373,
  title  = {An Efficient GPU-based Implementation for Noise Robust Sound Source Localization},
  author = {Zirui Lin and Masayuki Takigahira and Naoya Terakado and Haris Gulzar and Monikka Roslianna Busto and Takeharu Eda and Katsutoshi Itoyama and Kazuhiro Nakadai and Hideharu Amano},
  journal= {arXiv preprint arXiv:2504.03373},
  year   = {2025}
}

备注

6 pages, 2 figures