中文

噪声混响声学环境下单通道语音分离的时域 Conformer 模型研究

声音 2023-10-11 v1 人工智能 机器学习 音频与语音处理

摘要

语音分离仍是多说话人技术研究者的重要课题。卷积增强 transformer(conformer)在许多语音处理任务中表现良好,但在语音分离中研究不足。近期多数最优(SOTA)分离模型为时域音频分离网络(TasNet)。若干成功模型采用了双路径(DP)网络,其顺序处理局部与全局信息。时域 conformer(TD-Conformer)是 DP 方法的类比,其同样顺序处理局部与全局上下文,但具有不同时间复杂度函数。研究表明,在控制特征维度下,对于现实较短信号长度,conformer 更高效。我们提出下采样层以进一步提升计算效率。最佳 TD-Conformer 在 WHAMR 与 WSJ0-2Mix 基准上分别取得 14.6 dB 与 21.2 dB 的 SISDR 提升。

关键词

引用

@article{arxiv.2310.06125,
  title  = {On Time Domain Conformer Models for Monaural Speech Separation in Noisy Reverberant Acoustic Environments},
  author = {William Ravenscroft and Stefan Goetze and Thomas Hain},
  journal= {arXiv preprint arXiv:2310.06125},
  year   = {2023}
}

备注

Accepted at ASRU Workshop 2023