中文

低复杂度音频嵌入提取器

声音 2023-06-26 v2 音频与语音处理

摘要

利用深度学习模型解决说话人识别、音乐分类或语义音频事件标注等任务通常需要计算量庞大的网络。通用音频嵌入(GPAE)是音频信号的稠密表示,可使轻量、浅层分类器处理各类音频任务。其思路是:由单一复杂特征提取器提取稠密GPAE,而浅层MLP生成特定任务的预测。若所提取的稠密表示具有足够的通用性,使简单下游分类器能泛化至音频域的多种任务,则一次代价高昂的前向传播即可并行解决多个任务。本文试图降低GPAE提取器的成本,使其适用于资源受限设备。我们使用在AudioSet上训练的高效MobileNet,并通过来自Transformer集成模型的知识蒸馏作为高效GPAE提取器。我们探索如何从模型获得高质量GPAE,研究模型复杂度与所提取GPAE质量的关系,并得出结论:低复杂度模型能够生成具有竞争力的GPAE,为多任务音频分类与识别下的边缘设备音频流分析铺平道路。

关键词

引用

@article{arxiv.2303.01879,
  title  = {Low-Complexity Audio Embedding Extractors},
  author = {Florian Schmid and Khaled Koutini and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2303.01879},
  year   = {2023}
}

备注

In Proceedings of the 31st European Signal Processing Conference, EUSIPCO 2023. Source Code available at: https://github.com/fschmid56/EfficientAT_HEAR