使用自适应可学习波束成形器的多通道重放语音检测
音频与语音处理
2025-05-09 v2 信号处理
摘要
重放攻击属于针对语音控制系统的严重威胁之一,它通过录制和重放语音信号来利用语音信号的易获取性,从而获得对敏感数据的未授权访问。本文提出了一种名为 M-ALRAD 的多通道神经网络架构,用于基于空间音频特征检测重放攻击。该方法将可学习自适应波束成形器与卷积循环神经网络相结合,实现了空间滤波与分类的联合优化。实验在 ReMASC 数据集上进行,这是一个先进的多通道重放语音检测数据集,包含四种麦克风阵列配置和四种环境。在 ReMASC 数据集上的结果表明,该方法优于现有先进方法,并在具有挑战性的声学环境中取得了显著提升。此外,我们证明与以往研究相比,该方法能够更好地泛化到未见过的环境。
引用
@article{arxiv.2502.13473,
title = {Multi-channel Replay Speech Detection using an Adaptive Learnable Beamformer},
author = {Michael Neri and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2502.13473},
year = {2025}
}
备注
IEEE Open Journal of Signal Processing