中文

一种用于语音分离且具有自上而下注意力的高效编解码器架构

声音 2023-03-31 v5 机器学习 音频与语音处理

摘要

深度神经网络在语音分离任务中展现出良好前景。然而,在保持低模型复杂度的同时取得良好结果在现实应用中仍具挑战性。在本文中,我们通过模拟大脑的自上而下注意力,提供一种受生物启发的高效编解码器架构,称为 TDANet,在降低模型复杂度的同时不牺牲性能。TDANet 中的自上而下注意力由全局注意力(GA)模块和级联局部注意力(LA)层提取。GA 模块以多尺度声学特征为输入提取全局注意力信号,然后通过直接的自上而下连接调制不同尺度的特征。LA 层以相邻层特征为输入提取局部注意力信号,并以自上而下方式调制侧向输入。在三个基准数据集上,TDANet 以更高效率持续取得与先前最先进(SOTA)方法竞争的分离性能。具体而言,TDANet 的乘加运算(MACs)仅为先前 SOTA 模型之一 Sepformer 的 5%,CPU 推理时间仅为 Sepformer 的 10%。此外,TDANet 的大尺寸版本在三个数据集上取得 SOTA 结果,其 MACs 仍仅为 Sepformer 的 10%,CPU 推理时间仅为 Sepformer 的 24%。

关键词

引用

@article{arxiv.2209.15200,
  title  = {An efficient encoder-decoder architecture with top-down attention for speech separation},
  author = {Kai Li and Runxuan Yang and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2209.15200},
  year   = {2023}
}

备注

Accepted by ICLR 2023; Code & Demos: https://cslikai.cn/project/TDANet/