中文

AaSP:面向音频频谱图Transformer的抗混叠感知自监督预训练

声音 2026-05-15 v2 机器学习 机器学习

摘要

基于Transformer的音频自监督学习模型通常使用频谱图、视觉风格的Transformer以及掩码建模目标。然而,用于卷积分块的时间下采样会降低有效奈奎斯特频率并引入混叠,而朴素的低通滤波可能会移除任务相关的高频线索。我们提出了AaSP,一个面向音频频谱图Transformer的抗混叠感知自监督预训练框架。AaSP结合了抗混叠感知的分块表示、教师-学生掩码建模、交叉注意力预测器以及多掩码对比正则化,以学习能够整合易混叠调制频段特征同时在掩码视图间保持稳定性的表示。其分块嵌入模块——抗混叠感知分块嵌入(AaPE)——使用带限复正弦核与双边指数窗增强标准分块令牌,融入易混叠调制频段的特征。该核的频率和衰减参数由输入估计,使能自适应子带分析,其输出与标准分块令牌融合。我们在AudioSet上进行预训练,并通过在声学/环境、语音和音乐识别基准上的微调与线性评估来检验学到的表示。在微调方面,完整的AaSP框架在AS-20K、ESC-50和NSynth上取得了与对比自监督基线相比的最先进结果,同时在其他任务上保持竞争力。线性评估显示出类似的趋势,包括在US8K和NSynth上的增益。总体而言,AaSP学习到的表示在易混叠敏感的时间扰动下更加稳定,且在下游迁移任务上具有竞争力。

关键词

引用

@article{arxiv.2512.03637,
  title  = {AaSP: Aliasing-aware Self-Supervised Pre-Training for Audio Spectrogram Transformers},
  author = {Kohei Yamamoto and Kosuke Okusa},
  journal= {arXiv preprint arXiv:2512.03637},
  year   = {2026}
}

备注

Accepted for publication in IEEE Transactions on Audio, Speech and Language Processing (TALSP). Copyright IEEE