中文

用于高效语音增强的多视角注意力迁移

声音 2022-11-01 v2 机器学习 音频与语音处理

摘要

近期的深度学习模型在语音增强方面取得了高性能;然而,在不显著退化性能的前提下获得快速且低复杂度的模型仍然具有挑战性。以往关于语音增强的知识蒸馏研究未能解决该问题,因为其输出蒸馏方法在某些方面并不适配语音增强任务。在本研究中,我们提出多视角注意力迁移(MV-AT),一种基于特征的蒸馏方法,用于在时域中获得高效的语音增强模型。基于多视角特征提取模型,MV-AT 在无额外参数的情况下将教师网络的多视角知识迁移给学生网络。实验结果表明,所提方法在 Valentini 和深度噪声抑制(DNS)数据集上一致地提升了多种规模学生模型的性能。采用我们所提方法的轻量级高效部署模型 MANNER-S-8.1GF,在与基线模型性能相近的情况下,参数数量和浮点运算次数(FLOPs)分别减少了 15.4 倍和 4.71 倍。

关键词

引用

@article{arxiv.2208.10367,
  title  = {Multi-View Attention Transfer for Efficient Speech Enhancement},
  author = {Wooseok Shin and Hyun Joon Park and Jin Sob Kim and Byung Hoon Lee and Sung Won Han},
  journal= {arXiv preprint arXiv:2208.10367},
  year   = {2022}
}

备注

Proceedings of Interspeech 2022