面向移动说话者的阵列几何robust注意力型神经网络波束赋形器
音频与语音处理
2024-06-18 v2 声音
摘要
虽然基于掩码的波束赋形是一种强大的语音增强方法,但通常需要手动调参以处理移动说话者。最近,这种方法被增强了一个基于注意力的空间协方差矩阵聚合器 (ASA) 模块,使其能够在无需手动调参的情况下准确跟踪移动说话者。然而,该模块所使用的深度神经网络模型仅限于特定的麦克风阵列,针对不同的通道排列、数量或几何形状,需要不同的模型。为提高 ASA 模块在此类变化下的鲁棒性,本文研究了三种方法:使用随机通道配置进行训练、采用 transform-average-concatenate 方法处理多通道输入特征、以及利用鲁棒输入特征。我们在 CHiME-3 和 DEMAND 数据集上的实验表明,这些方法使增强了 ASA 的波束赋形器能够跟踪训练中未出现的不同麦克风阵列中的移动说话者。
引用
@article{arxiv.2402.03058,
title = {Array Geometry-Robust Attention-Based Neural Beamformer for Moving Speakers},
author = {Marvin Tammen and Tsubasa Ochiai and Marc Delcroix and Tomohiro Nakatani and Shoko Araki and Simon Doclo},
journal= {arXiv preprint arXiv:2402.03058},
year = {2024}
}
备注
accepted at Interspeech 2024