中文

AudioMAE++:使用 SwiGLU FFNs 学习更好的掩码音频表示

声音 2025-07-15 v1 人工智能 音频与语音处理

摘要

在音频频谱块上训练的掩码自编码器 (MAE) 已成为学习自监督音频表示的热门方法。尽管近期多个论文评估了在音频数据上训练 MAE 的关键方面,但大多数方法仍利用基础变换器构建模块,而变换器社区则持续集成较新的架构进展。在本文中,我们提出 AudioMAE++,一种更新的音频掩码自编码器,包含两种此类改进,即带有门控线性单元的 macaron 式变换器块。我们在 AudioSet 数据集上进行预训练,所提出的 AudioMAE++ 模型在 10 个多样化下游任务上优于现有基于 MAE 的方法,在音频分类和语音基准测试方面表现优异。所提出的 AudioMAE++ 模型还表现出出色的扩展特性,在参数数目提升最高可达 4 倍的情况下,仍优于直接可比的标准 MAE 基线。

关键词

引用

@article{arxiv.2507.10464,
  title  = {AudioMAE++: learning better masked audio representations with SwiGLU FFNs},
  author = {Sarthak Yadav and Sergios Theodoridis and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:2507.10464},
  year   = {2025}
}

备注

TO APPEAR AT IEEE MLSP 2025