中文

全频率时间分块与结构化掩码用于提升音频分类

声音 2025-09-01 v1 人工智能

摘要

Transformer 和状态空间模型(SSM)已通过将 spectrogram 视为离散补丁序列来推动音频分类进展。然而,现有模型如 Audio Spectrogram Transformer(AST) 和 Audio Mamba(AuM) 采用计算机视觉中的方形分块方式,这会破坏连续的频率模式,产生过多的补丁,从而减慢训练速度并增加计算开销。我们提出了全频率时间分块(FFTP),一种更符合 spectrogram 时间-频率非对称性的分块策略,通过跨越完整频率带并局部化时间上下文来实现,保留和谐结构,显著减少补丁数量和计算量。我们还引入 SpecMask,一种基于固定掩码预算的补丁对齐 spectrogram 增强方法,结合全频率和局部化时间-频率掩码,增强时序鲁棒性同时保持频谱连续性。在AST和AuM上应用后,我们的方法在 AudioSet-18k 上将平均精度(mAP)提升最高可达 +6.76,在 SpeechCommandsV2 上将准确率提升最高可达 +8.46,同时将计算量降低最高可达 83.26%,显现出在性能和效率方面的双重提升。

关键词

引用

@article{arxiv.2508.21243,
  title  = {Full-Frequency Temporal Patching and Structured Masking for Enhanced Audio Classification},
  author = {Aditya Makineni and Baocheng Geng and Qing Tian},
  journal= {arXiv preprint arXiv:2508.21243},
  year   = {2025}
}