中文

短时记忆卷积

机器学习 2023-02-10 v1 人工智能 声音 音频与语音处理

摘要

时间序列信号的实时处理是许多实际应用中的关键问题。实时处理的理念在音频领域尤为重要,因为人类听觉对感知信号中的任何干扰都十分敏感,尤其是听觉与视觉模态之间的延迟。深度学习(DL)模型的兴起使信号处理的格局变得复杂。尽管它们通常比标准数字信号处理(DSP)方法具有更优的质量,但这一优势被更高的延迟所削弱。在这项工作中,我们提出了一种用于最小化推理时间延迟和内存消耗的新方法,称为短时记忆卷积(STMC)及其转置对应形式。STMC的主要优势是与长短期记忆(LSTM)网络相当的低延迟。此外,基于STMC的模型训练更快且更稳定,因为该方法完全基于卷积神经网络(CNN)。在本研究中,我们展示了该方案在语音分离任务的U-Net模型以及声学场景分类(ASC)任务的GhostNet模型中的应用。在语音分离方面,我们在不影响输出质量的情况下实现了推理时间5倍降低和延迟2倍降低。ASC任务的推理时间最高加快4倍,同时保持了原始准确率。

关键词

引用

@article{arxiv.2302.04331,
  title  = {Short-Term Memory Convolutions},
  author = {Grzegorz Stefański and Krzysztof Arendt and Paweł Daniluk and Bartłomiej Jasik and Artur Szumaczuk},
  journal= {arXiv preprint arXiv:2302.04331},
  year   = {2023}
}

备注

ICLR 2023