中文

将音频掩码自编码器拓展至音频恢复

声音 2023-08-21 v2 音频与语音处理

摘要

音频分类与恢复是音频信号处理中的主要下游任务。然而,与预训练模型在分类任务中取得的巨大成功相比,恢复任务从预训练模型中获益较少。由于这种不均衡的获益,如何提升预训练模型在恢复任务(例如语音增强(SE))上的性能日益受到关注。先前工作表明,预训练音频编码器提取的特征对SE任务有效,但这些语音专用的仅编码器模型通常需要额外的解码器以适配SE,并涉及复杂的预训练流程或繁复的数据增强。因此,为追求通用音频模型,我们将以视觉Transformer自编码器(ViT-AE)为骨干的音频掩码自编码器(MAE)从音频分类拓展至SE这一具有成熟评价标准的代表性恢复任务。ViT-AE在预训练期间通过梅尔到梅尔的映射学习恢复被掩码的音频信号,这与SE等恢复任务类似。我们提出了多种ViT-AE变体以获得更好的SE性能,其中梅尔到梅尔变体在非侵入式指标上取得高分,而面向STFT的变体在PESQ等侵入式指标上表现有效。不同变体可按场景使用。综合评估揭示MAE预训练有益于SE任务,并帮助ViT-AE更好地泛化至域外失真。我们进一步发现,通用音频源的大规模含噪数据(而非干净语音)足以用于预训练。

关键词

引用

@article{arxiv.2305.06701,
  title  = {Extending Audio Masked Autoencoders Toward Audio Restoration},
  author = {Zhi Zhong and Hao Shi and Masato Hirano and Kazuki Shimada and Kazuya Tateishi and Takashi Shibuya and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2305.06701},
  year   = {2023}
}

备注

WASPAA 2023.Copyright 2023 IEEE.Personal use of this material is permitted.Permission from IEEE must be obtained for all other uses,in any current or future media,including reprinting/republishing this material for advertising or promotional purposes, creating new collective works,for resale or redistribution to servers or lists,or reuse of any copyrighted component of this work in other works