一模型增强所有:阵列几何无关的多通道个性化语音增强
音频与语音处理
2021-10-22 v1 声音
摘要
随着近期视频会议工具使用的激增,提供高质量语音信号与准确字幕已成为开展日常业务或与亲友联络的关键。在此类场景中,单通道个性化语音增强(PSE)方法相比无条件语音增强(SE)方法展现出良好前景,因其除环境噪声外还能去除干扰语音。本工作中,我们利用麦克风阵列提供的空间信息进一步提升此类系统的性能。我们研究了说话人嵌入与空间特征的相对重要性。此外,我们提出了一种新型的因果阵列几何无关多通道 PSE 模型,其能从任意麦克风几何结构生成高质量增强信号。实验结果表明,所提出的几何无关模型在语音质量与自动语音识别准确率上均优于在特定麦克风阵列几何上训练的模型。我们还展示了该方法对未见阵列几何的有效性。
引用
@article{arxiv.2110.10330,
title = {One model to enhance them all: array geometry agnostic multi-channel personalized speech enhancement},
author = {Hassan Taherian and Sefik Emre Eskimez and Takuya Yoshioka and Huaming Wang and Zhuo Chen and Xuedong Huang},
journal= {arXiv preprint arXiv:2110.10330},
year = {2021}
}
备注
Submitted to ICASSP 2022