基于注意力的 ad-hoc 麦克风阵列多通道说话人验证
声音
2021-07-02 v1 音频与语音处理
摘要
近来,ad-hoc 麦克风阵列得到了广泛研究。与传统麦克风阵列设置不同,ad-hoc 麦克风阵列的空间排布和麦克风数量事先未知,这阻碍了传统说话人验证技术向 ad-hoc 麦克风阵列的适配。为克服该弱点,本文提出基于注意力的 ad-hoc 麦克风阵列多通道说话人验证方法。具体而言,我们在单通道说话人验证系统的池化层之后添加了一个通道间处理层和一个全局融合层。通道间处理层沿通道维度应用所谓的残差自注意力,为不同麦克风分配权重。全局融合层以与输入通道数量无关的方式整合所有通道。我们进一步将残差自注意力中的 softmax 算子替换为 sparsemax,从而将极噪声通道的通道权重强制置零。在超过 30 通道的 ad-hoc 麦克风阵列上的实验结果表明了所提方法的有效性。例如,在通道数匹配与不匹配的测试场景中,基于 sparsemax 的多通道说话人验证在半真实数据集上取得了比 oracle 单最佳系统低逾 20% 的等错误率(EER),在仿真数据集上低逾 30%。
引用
@article{arxiv.2107.00178,
title = {Attention-based multi-channel speaker verification with ad-hoc microphone arrays},
author = {Chengdong Liang and Junqi Chen and Shanzheng Guan and Xiao-Lei Zhang},
journal= {arXiv preprint arXiv:2107.00178},
year = {2021}
}
备注
Submitted to APSIPA ASC 2021