利用信息化的复值空间自编码器挖掘空间信息以进行目标说话人提取
音频与语音处理
2023-06-13 v2 声音
摘要
在传统的多通道音频信号增强中,空间滤波与频谱滤波通常是顺序执行的。相反,已有研究表明,对于神经空间滤波,谱-空间滤波的联合方法更为有益。在本文中,我们研究此类时变谱-空间滤波器所执行的空间滤波。我们通过利用其可解释结构并有意将目标说话人位置告知网络,将最近提出的复值空间自编码器 (COSPA) 扩展到目标说话人提取任务。我们表明所得到的信息化 COSPA (iCOSPA) 能有效且灵活地从说话人混合中提取目标说话人。我们还发现所提出的架构能够很好地学习显著的空间选择性模式,并表明在计算各种评估指标时,结果显著依赖于训练目标与参考信号。
引用
@article{arxiv.2210.15512,
title = {Exploiting spatial information with the informed complex-valued spatial autoencoder for target speaker extraction},
author = {Annika Briegleb and Mhd Modar Halimeh and Walter Kellermann},
journal= {arXiv preprint arXiv:2210.15512},
year = {2023}
}
备注
Accepted to 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Rhodes Island, Greece. 5 pages, 2 figures