中文

时频调制:用于语音、音乐与环境声分类的高效可解释特征表示

声音 2025-08-20 v1 机器学习 音频与语音处理

摘要

音频DNN在各类机器听觉任务中表现出色;然而,其大多数表示计算成本高且不可解释,仍有优化空间。在此,我们提出一种以时频调制(STM)特征为核心的新方法,这是一种模拟人类听觉皮层神经生理学表示的信号处理方法。基于STM的模型在无需任何预训练的情况下,其在多样化自然语音、音乐和环境声音上的分类性能,与预训练的音频DNN相当,而这些声音类别对人类认知和机器感知都是至关重要的类别。这些结果表明,STM是一种用于音频分类的高效且可解释的特征表示,推动了机器听觉的发展,并为深入理解语音与听觉科学以及开发音频脑机接口和认知计算开启了令人兴奋的新可能。

关键词

引用

@article{arxiv.2505.23509,
  title  = {Spectrotemporal Modulation: Efficient and Interpretable Feature Representation for Classifying Speech, Music, and Environmental Sounds},
  author = {Andrew Chang and Yike Li and Iran R. Roman and David Poeppel},
  journal= {arXiv preprint arXiv:2505.23509},
  year   = {2025}
}

备注

Interspeech 2025