中文

AND:用于解释深度声学模型的音频网络剖析

声音 2024-07-12 v2 人工智能 音频与语音处理

摘要

神经元层面的解释旨在通过研究对特定感知或结构输入模式有响应的神经元来解释网络行为和属性。尽管在视觉和语言领域已有新兴工作,但在声学模型中尚无探索。为弥补这一差距,我们引入了AND\textit{AND},这是第一个音频网络剖析\textbf{音频网络剖析}框架,它基于高响应性音频自动建立声学神经元的自然语言解释。AND\textit{AND}的特色在于使用LLM来总结音频之间的共同声学特征和身份。我们进行了大量实验来验证AND\textit{AND}描述的精确性和信息量。此外,我们展示了AND\textit{AND}在音频机器遗忘中的一个潜在用途,即基于生成的描述进行概念特定的剪枝。最后,我们通过AND\textit{AND}的分析强调了两种声学模型行为:(i)模型通过组合基本声学特征而非高级抽象概念来区分音频;(ii)训练策略影响模型行为和神经元可解释性——监督训练引导神经元逐渐缩小其注意力范围,而自监督学习则鼓励神经元具有多语义性以探索高级特征。

关键词

引用

@article{arxiv.2406.16990,
  title  = {AND: Audio Network Dissection for Interpreting Deep Acoustic Models},
  author = {Tung-Yu Wu and Yu-Xiang Lin and Tsui-Wei Weng},
  journal= {arXiv preprint arXiv:2406.16990},
  year   = {2024}
}

备注

Accepted by ICML'24