用于多通道语音增强的通道间Conv-TasNet
音频与语音处理
2024-10-28 v1 声音
摘要
多通道环境下的语音增强通过利用嵌入在多个麦克风信号中的空间信息得以实现。此外,深度神经网络(DNNs)近年来在该领域取得进展;然而,关于充分挖掘空间信息和通道间关系的高效多通道网络结构的研究仍处于早期阶段。本研究提出一种端到端时域语音增强网络,可在DNN的各层促进通道间关系的利用。所提技术基于全卷积时域音频分离网络(Conv-TasNet),该网络最初为语音分离任务而开发。我们将Conv-TasNet扩展为多种可处理多通道输入信号并学习通道间关系的形态。为此,我们修改网络的编码器-掩码-解码器结构,使其兼容定义在空间通道、特征和时间维度上的3-D张量。特别地,我们对卷积结构进行了广泛的参数分析,并提出将深度可分离卷积和1×1卷积层分别独立分配给特征维度和空间维度。我们证明了所提网络丰富的通道间信息在抑制来自不同方向入射的噪声信号中起着重要作用。所提通道间Conv-TasNet优于最先进的多通道神经网络变体,即使参数规模仅为其十分之一。所提模型的性能使用CHiME-3数据集评估,在SDR、PESQ和STOI上均表现出显著改进。
引用
@article{arxiv.2111.04312,
title = {Inter-channel Conv-TasNet for multichannel speech enhancement},
author = {Dongheon Lee and Seongrae Kim and Jung-Woo Choi},
journal= {arXiv preprint arXiv:2111.04312},
year = {2024}
}
备注
10 pages, this work has been submitted to the IEEE for possible publication