基于掩蔽频谱图的自监督音频表征学习神经网络架构综述
声音
2025-09-24 v1 人工智能
音频与语音处理
摘要
近年来,自监督学习在无需标注数据训练深度神经表征方面引起了广泛关注。掩蔽频谱图建模是其中一种自监督学习方法,其目标是通过预测输入音频频谱图中被移除或隐藏的部分来学习语义丰富的上下文表征。以 Transformer 神经架构为核心,掩蔽频谱图建模已成为学习通用音频表征(即音频基础模型)的突出方法。与此同时,为解决 Transformer 架构的问题,特别是其随输入序列长度呈二次方扩展的底层缩放点积注意力操作,人们对循环序列建模方法重新产生了兴趣。其中,选择性结构化状态空间模型(如 Mamba)和扩展长短期记忆(xLSTM)是两种最具前景且被广泛采用的方法。尽管关于这两个主题的研究不断涌现,但目前仍缺乏对这两个主题交叉领域的充分综述。本文对上述研究领域进行了全面综述,涵盖掩蔽频谱图建模以及前述的神经序列建模架构 Mamba 和 xLSTM。此外,我们在一个统一且可复现的框架中,基于十项不同的下游音频分类任务对比了基于 Transformer、Mamba 和 xLSTM 的掩蔽频谱图模型,这将有助于感兴趣的读者评估这些方法对相关应用的适用性并做出明智决策。
引用
@article{arxiv.2509.18691,
title = {An overview of neural architectures for self-supervised audio representation learning from masked spectrograms},
author = {Sarthak Yadav and Sergios Theodoridis and Zheng-Hua Tan},
journal= {arXiv preprint arXiv:2509.18691},
year = {2025}
}