中文

面向全双工通信的个性化声学回声消除

声音 2022-07-01 v2 音频与语音处理

摘要

深度神经网络(DNNs)在声学回声消除(AEC)中已展现出有前景的结果。但基于 DNN 的 AEC 模型会让所有近端说话人(包括干扰语音)通过。鉴于近期关于个性化语音增强的研究,本文在全双工通信场景下探究个性化声学回声消除(PAEC)的可行性,其中背景噪声与干扰说话人可能与声学回声共存。具体而言,我们首先提出一种称为门控时间卷积神经网络(GTCNN)的新型骨干网络,其性能优于最先进的 AEC 模型。进一步采用 d-vectors 等说话人嵌入作为辅助信息,引导 GTCNN 聚焦于目标说话人。PAEC 中的一个特例是通话双方的语言片段均被注册。实验结果表明,来自近端或远端说话人的辅助信息均可改善基于 DNN 的 AEC 性能。然而,在有限维说话人嵌入的利用方面仍有很大改进空间。

关键词

引用

@article{arxiv.2205.15195,
  title  = {Personalized Acoustic Echo Cancellation for Full-duplex Communications},
  author = {Shimin Zhang and Ziteng Wang and Yukai Ju and Yihui Fu and Yueyue Na and Qiang Fu and Lei Xie},
  journal= {arXiv preprint arXiv:2205.15195},
  year   = {2022}
}

备注

submitted to INTERSPEECH 22