中文

神经元究竟倾听什么?面向通用音频模型的神经元层面剖析

音频与语音处理 2026-02-18 v1 声音

摘要

本文从神经元层面视角分析通用音频自监督学习 (SSL) 模型的内部表征。尽管这些模型在作为特征提取器方面表现出强大的经验性能,但支撑 SSL 音频模型健壮泛化的内部机制仍不清晰。我们在基于机械可解释性框架的基础上,通过分析跨不同任务中条件激活模式,识别并检查特定类别的神经元。我们的分析揭示了 SSL 模型促进特定类别神经元的出现,这些神经元在新任务类别中提供了广泛的覆盖。这些神经元在不同的语义类别和声学相似性(如语音属性和音乐音高)方面表现出共享响应。我们还确认了这些神经元对分类性能有实际影响。到我们知识,这是首次对通用音频 SSL 模型进行系统的神经元层面分析,为其内部表征提供了新见解。

关键词

引用

@article{arxiv.2602.15307,
  title  = {What Do Neurons Listen To? A Neuron-level Dissection of a General-purpose Audio Model},
  author = {Takao Kawamura and Daisuke Niizumi and Nobutaka Ono},
  journal= {arXiv preprint arXiv:2602.15307},
  year   = {2026}
}

备注

5 pages, 8 figures. Submitted to EUSIPCO 2026